Yuxu Ge commited on
Commit
f848a6a
·
1 Parent(s): f37a682

Publish Phase 1 LoRA adapters

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. .gitattributes +1 -0
  2. MANIFEST.sha256 +72 -0
  3. README.md +88 -0
  4. phase1/ablations/empty_context/README.md +80 -0
  5. phase1/ablations/empty_context/adapter_config.json +43 -0
  6. phase1/ablations/empty_context/adapter_model.safetensors +3 -0
  7. phase1/ablations/empty_context/chat_template.jinja +54 -0
  8. phase1/ablations/empty_context/tokenizer.json +3 -0
  9. phase1/ablations/empty_context/tokenizer_config.json +29 -0
  10. phase1/ablations/empty_context/training_args.bin +3 -0
  11. phase1/ablations/empty_context/training_recipe.json +22 -0
  12. phase1/ablations/empty_context/training_summary.json +2925 -0
  13. phase1/ablations/helps_only/README.md +80 -0
  14. phase1/ablations/helps_only/adapter_config.json +43 -0
  15. phase1/ablations/helps_only/adapter_model.safetensors +3 -0
  16. phase1/ablations/helps_only/chat_template.jinja +54 -0
  17. phase1/ablations/helps_only/tokenizer.json +3 -0
  18. phase1/ablations/helps_only/tokenizer_config.json +29 -0
  19. phase1/ablations/helps_only/training_args.bin +3 -0
  20. phase1/ablations/helps_only/training_recipe.json +22 -0
  21. phase1/ablations/helps_only/training_summary.json +2029 -0
  22. phase1/ablations/matched_clean/README.md +80 -0
  23. phase1/ablations/matched_clean/adapter_config.json +43 -0
  24. phase1/ablations/matched_clean/adapter_model.safetensors +3 -0
  25. phase1/ablations/matched_clean/chat_template.jinja +54 -0
  26. phase1/ablations/matched_clean/tokenizer.json +3 -0
  27. phase1/ablations/matched_clean/tokenizer_config.json +29 -0
  28. phase1/ablations/matched_clean/training_args.bin +3 -0
  29. phase1/ablations/matched_clean/training_recipe.json +22 -0
  30. phase1/ablations/matched_clean/training_summary.json +2925 -0
  31. phase1/ablations/no_context/README.md +80 -0
  32. phase1/ablations/no_context/adapter_config.json +43 -0
  33. phase1/ablations/no_context/adapter_model.safetensors +3 -0
  34. phase1/ablations/no_context/chat_template.jinja +54 -0
  35. phase1/ablations/no_context/tokenizer.json +3 -0
  36. phase1/ablations/no_context/tokenizer_config.json +29 -0
  37. phase1/ablations/no_context/training_args.bin +3 -0
  38. phase1/ablations/no_context/training_recipe.json +22 -0
  39. phase1/ablations/no_context/training_summary.json +2925 -0
  40. phase1/ablations/random_labels/README.md +80 -0
  41. phase1/ablations/random_labels/adapter_config.json +43 -0
  42. phase1/ablations/random_labels/adapter_model.safetensors +3 -0
  43. phase1/ablations/random_labels/chat_template.jinja +54 -0
  44. phase1/ablations/random_labels/tokenizer.json +3 -0
  45. phase1/ablations/random_labels/tokenizer_config.json +29 -0
  46. phase1/ablations/random_labels/training_args.bin +3 -0
  47. phase1/ablations/random_labels/training_recipe.json +22 -0
  48. phase1/ablations/random_labels/training_summary.json +2517 -0
  49. phase1/ablations/shuffled_documents/README.md +81 -0
  50. phase1/ablations/shuffled_documents/adapter_config.json +43 -0
.gitattributes CHANGED
@@ -23,6 +23,7 @@
23
  *.pth filter=lfs diff=lfs merge=lfs -text
24
  *.rar filter=lfs diff=lfs merge=lfs -text
25
  *.safetensors filter=lfs diff=lfs merge=lfs -text
 
26
  saved_model/**/* filter=lfs diff=lfs merge=lfs -text
27
  *.tar.* filter=lfs diff=lfs merge=lfs -text
28
  *.tar filter=lfs diff=lfs merge=lfs -text
 
23
  *.pth filter=lfs diff=lfs merge=lfs -text
24
  *.rar filter=lfs diff=lfs merge=lfs -text
25
  *.safetensors filter=lfs diff=lfs merge=lfs -text
26
+ **/tokenizer.json filter=lfs diff=lfs merge=lfs -text
27
  saved_model/**/* filter=lfs diff=lfs merge=lfs -text
28
  *.tar.* filter=lfs diff=lfs merge=lfs -text
29
  *.tar filter=lfs diff=lfs merge=lfs -text
MANIFEST.sha256 ADDED
@@ -0,0 +1,72 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ e7046ded3c2209e9a672bafd5d88ef404de69d10cc8a31cb0f3f29814ae80d8e phase1/ablations/empty_context/README.md
2
+ eb964f79f8e6f7ea2891c7d62fd4e4e0080de87c6998c03e0007524e57d7f34f phase1/ablations/empty_context/adapter_config.json
3
+ 79a128d64b87a92a3b4450386e35821dc796e494dca46b4d8c421b8580dbfd63 phase1/ablations/empty_context/adapter_model.safetensors
4
+ cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/ablations/empty_context/chat_template.jinja
5
+ 6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/ablations/empty_context/tokenizer.json
6
+ d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/ablations/empty_context/tokenizer_config.json
7
+ 4980eeedcdde01c95d37224943c3c64dcbeed7f0894c9e83bd99f12534a473fd phase1/ablations/empty_context/training_args.bin
8
+ 38881ae95ca349d9434dc02bf513b6fc157c642b6dd0f1671dc387eb59214767 phase1/ablations/empty_context/training_recipe.json
9
+ f7af5bbec6236061230e3955c84120341cea767726734f7d0e0240cdd83996c0 phase1/ablations/empty_context/training_summary.json
10
+ 510e129e1772049396993a6dee55abaa81f63b5764d03fadbb519ef6fafd076f phase1/ablations/helps_only/README.md
11
+ eb964f79f8e6f7ea2891c7d62fd4e4e0080de87c6998c03e0007524e57d7f34f phase1/ablations/helps_only/adapter_config.json
12
+ a143ad6c49a7a1b1d98e81af88412c91b367a394fa48a89517d6057fddf91748 phase1/ablations/helps_only/adapter_model.safetensors
13
+ cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/ablations/helps_only/chat_template.jinja
14
+ 6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/ablations/helps_only/tokenizer.json
15
+ d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/ablations/helps_only/tokenizer_config.json
16
+ 101d92ecb945e3232d561989c7a979ff91d184b4cccbe34a200a56060e3c5ce6 phase1/ablations/helps_only/training_args.bin
17
+ 99d8a8dd262b1543c87ce9adbffa30a7017e0a8eda928fa2d15e51213b3d563a phase1/ablations/helps_only/training_recipe.json
18
+ b28011dd1e9881bf6cd76d49411c2eb1d600ffd9b7fddb02e4a225fe6cbf10ba phase1/ablations/helps_only/training_summary.json
19
+ 6e949508412323e8d11526b703bec49eb0cf3b1f7d82d0cc1be01f2ed7f6e685 phase1/ablations/matched_clean/README.md
20
+ eb964f79f8e6f7ea2891c7d62fd4e4e0080de87c6998c03e0007524e57d7f34f phase1/ablations/matched_clean/adapter_config.json
21
+ 724b1e847a25563f7fe04d27dfa05df9213b97348490c4cf5b8f1c0cbdb90b68 phase1/ablations/matched_clean/adapter_model.safetensors
22
+ cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/ablations/matched_clean/chat_template.jinja
23
+ 6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/ablations/matched_clean/tokenizer.json
24
+ d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/ablations/matched_clean/tokenizer_config.json
25
+ cfafc3f2a531cdc31948a992577839650613ac2f09616d9263508e3e97da8555 phase1/ablations/matched_clean/training_args.bin
26
+ beb473536db2f62b9573ce70a0627393a709176bc1e3e19c140cec99f1db6112 phase1/ablations/matched_clean/training_recipe.json
27
+ bc5409a34a85f904abaac080ebb4be57ced1c64ee94e94587717876a6565a884 phase1/ablations/matched_clean/training_summary.json
28
+ 077a73a8683dea6ef8f3b30879101c55f2c7c3061ac00342e272f788ae48779f phase1/ablations/no_context/README.md
29
+ eb964f79f8e6f7ea2891c7d62fd4e4e0080de87c6998c03e0007524e57d7f34f phase1/ablations/no_context/adapter_config.json
30
+ 6f3a8ff3c19fd3e0ff728feab4e0a73a33c71608510f37d9dd27e53b74f97523 phase1/ablations/no_context/adapter_model.safetensors
31
+ cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/ablations/no_context/chat_template.jinja
32
+ 6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/ablations/no_context/tokenizer.json
33
+ d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/ablations/no_context/tokenizer_config.json
34
+ dd47c7f20edcbf52ada253a96ebd7ddcb8045bdd2a75f52fdd0f51ad7bc0183e phase1/ablations/no_context/training_args.bin
35
+ 1c7e4ab6940afc79f279336e739811171ce4a85c1198fb2a8baf4fd4cc6160b7 phase1/ablations/no_context/training_recipe.json
36
+ 91d8ec7a27b0ffe87b52ac7370ceffd78c910bacf142b7a9e942274ce26c8d0b phase1/ablations/no_context/training_summary.json
37
+ 81302140e113697d25464f222778a32a3a55dc576752d834b3b120e690833e5e phase1/ablations/random_labels/README.md
38
+ eb964f79f8e6f7ea2891c7d62fd4e4e0080de87c6998c03e0007524e57d7f34f phase1/ablations/random_labels/adapter_config.json
39
+ 7bebded9e10f63603bfd9d6a135dda87c8bcac25b4a43b365e2b1ce882bf4c93 phase1/ablations/random_labels/adapter_model.safetensors
40
+ cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/ablations/random_labels/chat_template.jinja
41
+ 6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/ablations/random_labels/tokenizer.json
42
+ d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/ablations/random_labels/tokenizer_config.json
43
+ ad84a00370d0c977fcd38a1fce033b130494f3fffd4a3c0cbc44a9dd43c0bdbf phase1/ablations/random_labels/training_args.bin
44
+ 986dd7375539ac325bec654e90e7d077b4bf7738a471d83d7aa47c4d9f1898fb phase1/ablations/random_labels/training_recipe.json
45
+ 4fcf1c2cc9c584de1ac096a5e7cb48babbd74b25d74c9973e654976f42d0be74 phase1/ablations/random_labels/training_summary.json
46
+ 6399ea44e270928871d5a50c1bc2c06eeb83d7ca10d5deaaeb78e4d41e859933 phase1/ablations/shuffled_documents/README.md
47
+ eb964f79f8e6f7ea2891c7d62fd4e4e0080de87c6998c03e0007524e57d7f34f phase1/ablations/shuffled_documents/adapter_config.json
48
+ c9d8b830ce2a3b583eb54eab7470a7b3acb9c163dee812de0313c454462de064 phase1/ablations/shuffled_documents/adapter_model.safetensors
49
+ cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/ablations/shuffled_documents/chat_template.jinja
50
+ 6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/ablations/shuffled_documents/tokenizer.json
51
+ d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/ablations/shuffled_documents/tokenizer_config.json
52
+ eaedd299a54d4c58a5c10cd9e379b80d44bbfd7922ccd578d5731f3e7adeb7cb phase1/ablations/shuffled_documents/training_args.bin
53
+ d37a5d995c8264d0abffeff9171478803b7b22412780c4e8226bf0b857f96235 phase1/ablations/shuffled_documents/training_recipe.json
54
+ 2e8d728d08c0bcc0212162c3cdd9295f5c982d92f65316f19f78c055a8c5589c phase1/ablations/shuffled_documents/training_summary.json
55
+ 4d1f59c2d09544c2e0397996d8032202fff701109f5e7320c48a72c7fa005b70 phase1/llama-dpo-v3/README.md
56
+ 18239fcf982739e03a128d680ac81ec7f05e0f058c032bed56a51376d7da731e phase1/llama-dpo-v3/adapter_config.json
57
+ 2633d2be48f838d5c4404786ca9baa38ff2b0ed66d2fa5d7d11eb74fe63c178d phase1/llama-dpo-v3/adapter_model.safetensors
58
+ 5816fce10444e03c2e9ee1ef8a4a1ea61ae7e69e438613f3b17b69d0426223a4 phase1/llama-dpo-v3/chat_template.jinja
59
+ b20d148821d1e209454ef0d54a1d2bb1ff12cd365a0ff5391d96010e897b9644 phase1/llama-dpo-v3/tokenizer.json
60
+ 85795daec85614d3918187e7bd6d3548a0de064dc66e365db30bdea9d7b71dc3 phase1/llama-dpo-v3/tokenizer_config.json
61
+ fced63a90802dbed1aa84b5b0863e967f730e08882f30d6a2cec2f76954c2675 phase1/llama-dpo-v3/training_args.bin
62
+ a8d5a947873a04a1bbbc7972465db555eee1cf238d06c7f30f3d698056ee3d4e phase1/llama-dpo-v3/training_recipe.json
63
+ 55c87632a89ed152627178af35294d6c5c11096f8af740c682141925ad0aa122 phase1/llama-dpo-v3/training_summary.json
64
+ 512f4df0376b902685fe95ad685ea8b06c1112bec0cdf3ae7c7b7db7eb462664 phase1/qwen-main-dpo-v3/README.md
65
+ f59cbec9982518824aa800f9fbc56b764fc73098422cb4e81f2e70d6099d26a2 phase1/qwen-main-dpo-v3/adapter_config.json
66
+ cc60e5fe47be9bf4f64d734d40d89310a4826d8156d0ab8221b466f21c5efd58 phase1/qwen-main-dpo-v3/adapter_model.safetensors
67
+ cd8e9439f0570856fd70470bf8889ebd8b5d1107207f67a5efb46e342330527f phase1/qwen-main-dpo-v3/chat_template.jinja
68
+ 6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5 phase1/qwen-main-dpo-v3/tokenizer.json
69
+ d9bf1d78a80bad5eb65b83c2608910e3be00a9d3250c8153a5a393ad1257e1d6 phase1/qwen-main-dpo-v3/tokenizer_config.json
70
+ 1578389f7f0fe332b393d7d42285d2a1a804b2efc9a174e73d1805a5ca67e41b phase1/qwen-main-dpo-v3/training_args.bin
71
+ 3e8d64f2b8fcf2d9259644c9b919fc9597a450d3ec89eae738a467fded895a88 phase1/qwen-main-dpo-v3/training_recipe.json
72
+ 5263a105fa846c7cf3ddbb03ede58f4956c25f0e7a8ae38f9f8974930d16518b phase1/qwen-main-dpo-v3/training_summary.json
README.md ADDED
@@ -0,0 +1,88 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: peft
3
+ tags:
4
+ - dpo
5
+ - lora
6
+ - peft
7
+ - self-training
8
+ - transformers
9
+ - trl
10
+ pipeline_tag: text-generation
11
+ ---
12
+
13
+ # York Milestone Project — Phase 1 adapters
14
+
15
+ Hugging Face 仓库:
16
+ [`geyuxu/york-milestone-project-self-traing-loop-model`](https://huggingface.co/geyuxu/york-milestone-project-self-traing-loop-model)
17
+
18
+ 本仓库保存一期 v3 的最终 PEFT LoRA-DPO adapter,用于复现实验和后续阶段复用。
19
+ 它不包含基础模型权重、完整训练 checkpoint、合成数据、评测输出或原始 API 响应。
20
+
21
+ ## 内容
22
+
23
+ | 路径 | 基础模型 | 用途 | 训练 / 验证偏好对 |
24
+ | --- | --- | --- | ---: |
25
+ | `phase1/qwen-main-dpo-v3/` | `Qwen/Qwen2.5-1.5B-Instruct` | 一期主实验 | 99,986 / 11,110 |
26
+ | `phase1/llama-dpo-v3/` | `meta-llama/Llama-3.2-1B-Instruct` | 跨模型迁移实验 | 99,986 / 11,110 |
27
+ | `phase1/ablations/empty_context/` | Qwen2.5-1.5B-Instruct | 诊断消融 | 77,124 / 8,563 |
28
+ | `phase1/ablations/helps_only/` | Qwen2.5-1.5B-Instruct | 诊断消融 | 77,124 / 8,563 |
29
+ | `phase1/ablations/matched_clean/` | Qwen2.5-1.5B-Instruct | 诊断消融 | 77,124 / 8,563 |
30
+ | `phase1/ablations/no_context/` | Qwen2.5-1.5B-Instruct | 诊断消融 | 77,124 / 8,563 |
31
+ | `phase1/ablations/random_labels/` | Qwen2.5-1.5B-Instruct | 诊断消融 | 77,124 / 8,563 |
32
+ | `phase1/ablations/shuffled_documents/` | Qwen2.5-1.5B-Instruct | 诊断消融 | 77,124 / 8,563 |
33
+
34
+ 每个目录包含:
35
+
36
+ - `adapter_model.safetensors` 和 `adapter_config.json`;
37
+ - 与导出时一致的 tokenizer 和 chat template;
38
+ - `training_recipe.json`:冻结的数据成员哈希及核心训练参数;
39
+ - `training_summary.json`:训练步数、日志和最终摘要;
40
+ - `training_args.bin`:Transformers 训练参数快照。
41
+
42
+ ## 加载 adapter
43
+
44
+ 以下示例加载 Qwen 主实验。其他 adapter 只需替换 `subfolder` 和对应的
45
+ `base_id`:
46
+
47
+ ```python
48
+ from peft import PeftModel
49
+ from transformers import AutoModelForCausalLM, AutoTokenizer
50
+
51
+ repo_id = "geyuxu/york-milestone-project-self-traing-loop-model"
52
+ subfolder = "phase1/qwen-main-dpo-v3"
53
+ base_id = "Qwen/Qwen2.5-1.5B-Instruct"
54
+
55
+ tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder)
56
+ base_model = AutoModelForCausalLM.from_pretrained(
57
+ base_id,
58
+ torch_dtype="auto",
59
+ device_map="auto",
60
+ )
61
+ model = PeftModel.from_pretrained(
62
+ base_model,
63
+ repo_id,
64
+ subfolder=subfolder,
65
+ )
66
+ ```
67
+
68
+ Llama adapter 需要先在 Hugging Face 接受
69
+ `meta-llama/Llama-3.2-1B-Instruct` 的访问条款,并使用有权限的账户登录。
70
+
71
+ ## 完整性验证
72
+
73
+ 从仓库根目录执行:
74
+
75
+ ```bash
76
+ sha256sum -c MANIFEST.sha256
77
+ ```
78
+
79
+ `MANIFEST.sha256` 覆盖 `phase1/` 下发布的全部文件。Safetensors 通过 Git LFS
80
+ 管理;基础模型权重不会被提交到本仓库。
81
+
82
+ ## 许可证与限制
83
+
84
+ - Qwen adapter 依赖 Apache-2.0 许可的 Qwen2.5 基础模型;
85
+ - Llama adapter 的使用受 Llama 3.2 Community License 及其访问条款约束;
86
+ - 训练数据的来源、许可和限制以配套数据仓库的 dataset card 为准。
87
+
88
+ 这些 adapter 是研究实验产物,未针对生产安全、事实准确性或具体行业用途做保证。
phase1/ablations/empty_context/README.md ADDED
@@ -0,0 +1,80 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: peft
3
+ model_name: phase1-qwen-empty-context-ablation
4
+ tags:
5
+ - base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct
6
+ - dpo
7
+ - lora
8
+ - transformers
9
+ - trl
10
+ license: apache-2.0
11
+ base_model: Qwen/Qwen2.5-1.5B-Instruct
12
+ pipeline_tag: text-generation
13
+ ---
14
+
15
+ # Phase 1 Qwen `empty_context` diagnostic ablation
16
+
17
+ This is the Phase 1 `empty_context` diagnostic LoRA-DPO adapter fine-tuned from
18
+ [Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct).
19
+ The frozen training recipe and membership hashes are included in this directory.
20
+
21
+ ## Quick start
22
+
23
+ ```python
24
+ from peft import PeftModel
25
+ from transformers import AutoModelForCausalLM, AutoTokenizer
26
+
27
+ repo_id = "geyuxu/york-milestone-project-self-traing-loop-model"
28
+ subfolder = "phase1/ablations/empty_context"
29
+ base_id = "Qwen/Qwen2.5-1.5B-Instruct"
30
+
31
+ tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder)
32
+ base_model = AutoModelForCausalLM.from_pretrained(
33
+ base_id, torch_dtype="auto", device_map="auto"
34
+ )
35
+ model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder)
36
+ ```
37
+
38
+ ## Training procedure
39
+
40
+
41
+
42
+
43
+
44
+ This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290).
45
+
46
+ ### Framework versions
47
+
48
+ - PEFT 0.18.1
49
+ - TRL: 0.29.0
50
+ - Transformers: 5.3.0
51
+ - Pytorch: 2.10.0
52
+ - Datasets: 4.6.1
53
+ - Tokenizers: 0.22.2
54
+
55
+ ## Citations
56
+
57
+ Cite DPO as:
58
+
59
+ ```bibtex
60
+ @inproceedings{rafailov2023direct,
61
+ title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}},
62
+ author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn},
63
+ year = 2023,
64
+ booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023},
65
+ url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html},
66
+ editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine},
67
+ }
68
+ ```
69
+
70
+ Cite TRL as:
71
+
72
+ ```bibtex
73
+ @software{vonwerra2020trl,
74
+ title = {{TRL: Transformers Reinforcement Learning}},
75
+ author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin},
76
+ license = {Apache-2.0},
77
+ url = {https://github.com/huggingface/trl},
78
+ year = {2020}
79
+ }
80
+ ```
phase1/ablations/empty_context/adapter_config.json ADDED
@@ -0,0 +1,43 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 32,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "megatron_config": null,
23
+ "megatron_core": "megatron.core",
24
+ "modules_to_save": null,
25
+ "peft_type": "LORA",
26
+ "peft_version": "0.18.1",
27
+ "qalora_group_size": 16,
28
+ "r": 16,
29
+ "rank_pattern": {},
30
+ "revision": null,
31
+ "target_modules": [
32
+ "v_proj",
33
+ "k_proj",
34
+ "o_proj",
35
+ "q_proj"
36
+ ],
37
+ "target_parameters": null,
38
+ "task_type": "CAUSAL_LM",
39
+ "trainable_token_indices": null,
40
+ "use_dora": false,
41
+ "use_qalora": false,
42
+ "use_rslora": false
43
+ }
phase1/ablations/empty_context/adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:79a128d64b87a92a3b4450386e35821dc796e494dca46b4d8c421b8580dbfd63
3
+ size 17462432
phase1/ablations/empty_context/chat_template.jinja ADDED
@@ -0,0 +1,54 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0]['role'] == 'system' %}
4
+ {{- messages[0]['content'] }}
5
+ {%- else %}
6
+ {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }}
7
+ {%- endif %}
8
+ {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
9
+ {%- for tool in tools %}
10
+ {{- "\n" }}
11
+ {{- tool | tojson }}
12
+ {%- endfor %}
13
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
14
+ {%- else %}
15
+ {%- if messages[0]['role'] == 'system' %}
16
+ {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }}
17
+ {%- else %}
18
+ {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }}
19
+ {%- endif %}
20
+ {%- endif %}
21
+ {%- for message in messages %}
22
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %}
23
+ {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
24
+ {%- elif message.role == "assistant" %}
25
+ {{- '<|im_start|>' + message.role }}
26
+ {%- if message.content %}
27
+ {{- '\n' + message.content }}
28
+ {%- endif %}
29
+ {%- for tool_call in message.tool_calls %}
30
+ {%- if tool_call.function is defined %}
31
+ {%- set tool_call = tool_call.function %}
32
+ {%- endif %}
33
+ {{- '\n<tool_call>\n{"name": "' }}
34
+ {{- tool_call.name }}
35
+ {{- '", "arguments": ' }}
36
+ {{- tool_call.arguments | tojson }}
37
+ {{- '}\n</tool_call>' }}
38
+ {%- endfor %}
39
+ {{- '<|im_end|>\n' }}
40
+ {%- elif message.role == "tool" %}
41
+ {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %}
42
+ {{- '<|im_start|>user' }}
43
+ {%- endif %}
44
+ {{- '\n<tool_response>\n' }}
45
+ {{- message.content }}
46
+ {{- '\n</tool_response>' }}
47
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
48
+ {{- '<|im_end|>\n' }}
49
+ {%- endif %}
50
+ {%- endif %}
51
+ {%- endfor %}
52
+ {%- if add_generation_prompt %}
53
+ {{- '<|im_start|>assistant\n' }}
54
+ {%- endif %}
phase1/ablations/empty_context/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5
3
+ size 11422166
phase1/ablations/empty_context/tokenizer_config.json ADDED
@@ -0,0 +1,29 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": null,
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|im_start|>",
10
+ "<|im_end|>",
11
+ "<|object_ref_start|>",
12
+ "<|object_ref_end|>",
13
+ "<|box_start|>",
14
+ "<|box_end|>",
15
+ "<|quad_start|>",
16
+ "<|quad_end|>",
17
+ "<|vision_start|>",
18
+ "<|vision_end|>",
19
+ "<|vision_pad|>",
20
+ "<|image_pad|>",
21
+ "<|video_pad|>"
22
+ ],
23
+ "is_local": true,
24
+ "model_max_length": 131072,
25
+ "pad_token": "<|endoftext|>",
26
+ "split_special_tokens": false,
27
+ "tokenizer_class": "Qwen2Tokenizer",
28
+ "unk_token": null
29
+ }
phase1/ablations/empty_context/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4980eeedcdde01c95d37224943c3c64dcbeed7f0894c9e83bd99f12534a473fd
3
+ size 5841
phase1/ablations/empty_context/training_recipe.json ADDED
@@ -0,0 +1,22 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "format_version": 1,
3
+ "experiment": "confusion_ablation",
4
+ "ablation": "empty_context",
5
+ "model_name": "Qwen/Qwen2.5-1.5B-Instruct",
6
+ "train_membership_sha256": "b497fa765223a9810ad784f31e1598edfa992a162146d6f94d9cdf4adcedd87d",
7
+ "validation_membership_sha256": "2f609467438cd6a01fd84b9d80c0fcd84c44767e3b2ed98f4f6a83d68a62c181",
8
+ "num_train_pairs": 77124,
9
+ "num_validation_pairs": 8563,
10
+ "transformation_seed": 22,
11
+ "validation_prompt_mode": "clean_rag",
12
+ "learning_rate": 1e-05,
13
+ "beta": 0.1,
14
+ "num_epochs": 1.0,
15
+ "seed": 22,
16
+ "max_length": 512,
17
+ "max_prompt_length": 384,
18
+ "gradient_accumulation_steps": 80,
19
+ "save_steps": 125,
20
+ "save_total_limit": 12,
21
+ "preference_pairs_format_version": 2
22
+ }
phase1/ablations/empty_context/training_summary.json ADDED
@@ -0,0 +1,2925 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_name": "Qwen/Qwen2.5-1.5B-Instruct",
3
+ "resolved_model": "Qwen/Qwen2.5-1.5B-Instruct",
4
+ "num_train_records": 77124,
5
+ "num_validation_records_available": 8563,
6
+ "training_config": {
7
+ "lora_rank": 16,
8
+ "lora_alpha": 32,
9
+ "learning_rate": 1e-05,
10
+ "num_epochs": 1.0,
11
+ "per_device_batch_size": 1,
12
+ "per_device_eval_batch_size": 1,
13
+ "gradient_accumulation_steps": 80,
14
+ "beta": 0.1,
15
+ "max_length": 512,
16
+ "max_prompt_length": 384,
17
+ "seed": 22,
18
+ "save_steps": 125,
19
+ "save_total_limit": 12,
20
+ "resume_from_checkpoint": null,
21
+ "precision_dtype": "torch.bfloat16",
22
+ "bf16": true,
23
+ "fp16": false,
24
+ "tokenizer_add_bos_token": false
25
+ },
26
+ "global_step": 965,
27
+ "best_metric": 0.5264487266540527,
28
+ "best_model_checkpoint": "outputs/confusion_ablation_phase1_repair_v3/empty_context/lora/checkpoint-875",
29
+ "train_metrics": {
30
+ "train_runtime": 22398.3946,
31
+ "train_samples_per_second": 3.443,
32
+ "train_steps_per_second": 0.043,
33
+ "total_flos": 1.3308435135621734e+17,
34
+ "train_loss": 0.48160764293967134
35
+ },
36
+ "log_history": [
37
+ {
38
+ "loss": 0.6885997772216796,
39
+ "grad_norm": 0.012969385832548141,
40
+ "learning_rate": 9.906735751295338e-06,
41
+ "entropy": 1.0798783786967396,
42
+ "num_tokens": 156534.0,
43
+ "logits/chosen": -0.7346464429003529,
44
+ "logits/rejected": -0.7633830132317224,
45
+ "mean_token_accuracy": 0.689994627982378,
46
+ "rewards/chosen": 0.004463997096299863,
47
+ "rewards/rejected": -0.005229698287648716,
48
+ "rewards/accuracies": 0.5475,
49
+ "rewards/margins": 0.009693695359455887,
50
+ "logps/chosen": -53.64696934700012,
51
+ "logps/rejected": -45.47284424066544,
52
+ "epoch": 0.010372905969607386,
53
+ "step": 10
54
+ },
55
+ {
56
+ "loss": 0.6514244079589844,
57
+ "grad_norm": 0.01852896623313427,
58
+ "learning_rate": 9.803108808290156e-06,
59
+ "entropy": 1.1224612561706453,
60
+ "num_tokens": 313607.0,
61
+ "logits/chosen": -0.6341513052007935,
62
+ "logits/rejected": -0.6562745898278561,
63
+ "mean_token_accuracy": 0.6891892428323626,
64
+ "rewards/chosen": 0.03406709198377939,
65
+ "rewards/rejected": -0.05670502469384701,
66
+ "rewards/accuracies": 0.7825,
67
+ "rewards/margins": 0.09077211681949848,
68
+ "logps/chosen": -55.87430178999901,
69
+ "logps/rejected": -44.03523090600967,
70
+ "epoch": 0.02074581193921477,
71
+ "step": 20
72
+ },
73
+ {
74
+ "loss": 0.6161895275115967,
75
+ "grad_norm": 0.009809216484427452,
76
+ "learning_rate": 9.699481865284975e-06,
77
+ "entropy": 1.2153802848607302,
78
+ "num_tokens": 471990.0,
79
+ "logits/chosen": -0.5183433123187651,
80
+ "logits/rejected": -0.48201045809287074,
81
+ "mean_token_accuracy": 0.6826715680211782,
82
+ "rewards/chosen": 0.03547020315836562,
83
+ "rewards/rejected": -0.15197590536190547,
84
+ "rewards/accuracies": 0.76625,
85
+ "rewards/margins": 0.18744610846129944,
86
+ "logps/chosen": -55.871621309518815,
87
+ "logps/rejected": -47.164069904088976,
88
+ "epoch": 0.031118717908822157,
89
+ "step": 30
90
+ },
91
+ {
92
+ "loss": 0.5837482929229736,
93
+ "grad_norm": 0.009694655425846577,
94
+ "learning_rate": 9.595854922279793e-06,
95
+ "entropy": 1.2649927862174808,
96
+ "num_tokens": 630457.0,
97
+ "logits/chosen": -0.41558199378068605,
98
+ "logits/rejected": -0.36016731520911593,
99
+ "mean_token_accuracy": 0.6745159946288913,
100
+ "rewards/chosen": 0.0030272094297106376,
101
+ "rewards/rejected": -0.28438122774517977,
102
+ "rewards/accuracies": 0.78,
103
+ "rewards/margins": 0.2874084369814955,
104
+ "logps/chosen": -56.05272542119026,
105
+ "logps/rejected": -47.54765802979469,
106
+ "epoch": 0.04149162387842954,
107
+ "step": 40
108
+ },
109
+ {
110
+ "loss": 0.5699157238006591,
111
+ "grad_norm": 0.00790126621723175,
112
+ "learning_rate": 9.492227979274612e-06,
113
+ "entropy": 1.3643021282646806,
114
+ "num_tokens": 788279.0,
115
+ "logits/chosen": -0.2938073242511318,
116
+ "logits/rejected": -0.2156574113712712,
117
+ "mean_token_accuracy": 0.6769538759440183,
118
+ "rewards/chosen": -0.057574519852860245,
119
+ "rewards/rejected": -0.4283463936719636,
120
+ "rewards/accuracies": 0.77,
121
+ "rewards/margins": 0.37077187476679685,
122
+ "logps/chosen": -57.178628134727475,
123
+ "logps/rejected": -48.340812134742734,
124
+ "epoch": 0.051864529848036925,
125
+ "step": 50
126
+ },
127
+ {
128
+ "loss": 0.5565647125244141,
129
+ "grad_norm": 0.007377359550446272,
130
+ "learning_rate": 9.388601036269432e-06,
131
+ "entropy": 1.4374694915488362,
132
+ "num_tokens": 944837.0,
133
+ "logits/chosen": -0.24100234533637963,
134
+ "logits/rejected": -0.15933266229535895,
135
+ "mean_token_accuracy": 0.6763953970745206,
136
+ "rewards/chosen": -0.11264537643779476,
137
+ "rewards/rejected": -0.5672522658561502,
138
+ "rewards/accuracies": 0.77125,
139
+ "rewards/margins": 0.4546068909333553,
140
+ "logps/chosen": -56.07041595697403,
141
+ "logps/rejected": -49.03205164551735,
142
+ "epoch": 0.062237435817644314,
143
+ "step": 60
144
+ },
145
+ {
146
+ "loss": 0.5234037876129151,
147
+ "grad_norm": 0.008119487203657627,
148
+ "learning_rate": 9.284974093264249e-06,
149
+ "entropy": 1.4613975173421203,
150
+ "num_tokens": 1102438.0,
151
+ "logits/chosen": -0.2570220845928096,
152
+ "logits/rejected": -0.08345125228558167,
153
+ "mean_token_accuracy": 0.6671836027130484,
154
+ "rewards/chosen": -0.20022683466155286,
155
+ "rewards/rejected": -0.7679086389223813,
156
+ "rewards/accuracies": 0.7875,
157
+ "rewards/margins": 0.5676818046835251,
158
+ "logps/chosen": -58.67170790791511,
159
+ "logps/rejected": -51.08670456886291,
160
+ "epoch": 0.0726103417872517,
161
+ "step": 70
162
+ },
163
+ {
164
+ "loss": 0.5317386150360107,
165
+ "grad_norm": 0.008479549549520016,
166
+ "learning_rate": 9.181347150259067e-06,
167
+ "entropy": 1.5662438894622028,
168
+ "num_tokens": 1259718.0,
169
+ "logits/chosen": -0.19741540588436432,
170
+ "logits/rejected": -0.05688106650755805,
171
+ "mean_token_accuracy": 0.6640376079455018,
172
+ "rewards/chosen": -0.30314797887514944,
173
+ "rewards/rejected": -0.9170537282113219,
174
+ "rewards/accuracies": 0.775,
175
+ "rewards/margins": 0.6139057491905987,
176
+ "logps/chosen": -58.94739377617836,
177
+ "logps/rejected": -54.774017692804335,
178
+ "epoch": 0.08298324775685909,
179
+ "step": 80
180
+ },
181
+ {
182
+ "loss": 0.524826192855835,
183
+ "grad_norm": 0.008542119525372982,
184
+ "learning_rate": 9.077720207253888e-06,
185
+ "entropy": 1.5676167696528136,
186
+ "num_tokens": 1416640.0,
187
+ "logits/chosen": -0.19087733562866938,
188
+ "logits/rejected": -0.06961324446158064,
189
+ "mean_token_accuracy": 0.6602621851768344,
190
+ "rewards/chosen": -0.32906408929731695,
191
+ "rewards/rejected": -1.0247976127301808,
192
+ "rewards/accuracies": 0.78,
193
+ "rewards/margins": 0.6957335224747658,
194
+ "logps/chosen": -59.972526935338976,
195
+ "logps/rejected": -54.91353523254394,
196
+ "epoch": 0.09335615372646647,
197
+ "step": 90
198
+ },
199
+ {
200
+ "loss": 0.5366811752319336,
201
+ "grad_norm": 0.01028946042060852,
202
+ "learning_rate": 8.974093264248706e-06,
203
+ "entropy": 1.6082658682204782,
204
+ "num_tokens": 1578582.0,
205
+ "logits/chosen": -0.13524073540751783,
206
+ "logits/rejected": -0.03532241128049209,
207
+ "mean_token_accuracy": 0.6632538431324064,
208
+ "rewards/chosen": -0.45744188758188103,
209
+ "rewards/rejected": -1.1608894589025294,
210
+ "rewards/accuracies": 0.75625,
211
+ "rewards/margins": 0.7034475702582859,
212
+ "logps/chosen": -65.19879947781563,
213
+ "logps/rejected": -61.238030140399935,
214
+ "epoch": 0.10372905969607385,
215
+ "step": 100
216
+ },
217
+ {
218
+ "loss": 0.5021177291870117,
219
+ "grad_norm": 0.009549791924655437,
220
+ "learning_rate": 8.870466321243523e-06,
221
+ "entropy": 1.580866142194718,
222
+ "num_tokens": 1736902.0,
223
+ "logits/chosen": -0.16430359268125203,
224
+ "logits/rejected": -0.02982257553996645,
225
+ "mean_token_accuracy": 0.6615490332618356,
226
+ "rewards/chosen": -0.4121622362524067,
227
+ "rewards/rejected": -1.1860957287461498,
228
+ "rewards/accuracies": 0.80375,
229
+ "rewards/margins": 0.7739334937836975,
230
+ "logps/chosen": -60.39180130243302,
231
+ "logps/rejected": -55.96378324866295,
232
+ "epoch": 0.11410196566568125,
233
+ "step": 110
234
+ },
235
+ {
236
+ "loss": 0.5247333526611329,
237
+ "grad_norm": 0.007295758463442326,
238
+ "learning_rate": 8.766839378238343e-06,
239
+ "entropy": 1.5716826527751981,
240
+ "num_tokens": 1894607.0,
241
+ "logits/chosen": -0.21342730308044772,
242
+ "logits/rejected": -0.08283230979493357,
243
+ "mean_token_accuracy": 0.668023902028799,
244
+ "rewards/chosen": -0.4445982250826205,
245
+ "rewards/rejected": -1.1845778720156523,
246
+ "rewards/accuracies": 0.76875,
247
+ "rewards/margins": 0.7399796470795991,
248
+ "logps/chosen": -61.616042573452,
249
+ "logps/rejected": -53.51006484746933,
250
+ "epoch": 0.12447487163528863,
251
+ "step": 120
252
+ },
253
+ {
254
+ "eval_loss": 0.5866048336029053,
255
+ "eval_runtime": 186.3701,
256
+ "eval_samples_per_second": 5.366,
257
+ "eval_steps_per_second": 5.366,
258
+ "eval_entropy": 1.026585803925991,
259
+ "eval_num_tokens": 1973585.0,
260
+ "eval_logits/chosen": -0.27179382896787163,
261
+ "eval_logits/rejected": -0.1471519449829466,
262
+ "eval_mean_token_accuracy": 0.7038057380318642,
263
+ "eval_rewards/chosen": -0.4332459507464664,
264
+ "eval_rewards/rejected": -0.8382879723370134,
265
+ "eval_rewards/accuracies": 0.673,
266
+ "eval_rewards/margins": 0.40504202180169524,
267
+ "eval_logps/chosen": -54.505446267127994,
268
+ "eval_logps/rejected": -61.022751308441165,
269
+ "epoch": 0.1296613246200923,
270
+ "step": 125
271
+ },
272
+ {
273
+ "loss": 0.5197542190551758,
274
+ "grad_norm": 0.007421356160193682,
275
+ "learning_rate": 8.663212435233162e-06,
276
+ "entropy": 1.6153548054210842,
277
+ "num_tokens": 2053549.0,
278
+ "logits/chosen": -0.16180727962310634,
279
+ "logits/rejected": -0.02674481546655947,
280
+ "mean_token_accuracy": 0.6631045359373092,
281
+ "rewards/chosen": -0.44111566214839515,
282
+ "rewards/rejected": -1.2121200907422462,
283
+ "rewards/accuracies": 0.7875,
284
+ "rewards/margins": 0.7710044272383675,
285
+ "logps/chosen": -60.93198619604111,
286
+ "logps/rejected": -57.747130882740024,
287
+ "epoch": 0.13484777760489602,
288
+ "step": 130
289
+ },
290
+ {
291
+ "loss": 0.5147777080535889,
292
+ "grad_norm": 0.009197528474032879,
293
+ "learning_rate": 8.55958549222798e-06,
294
+ "entropy": 1.5458942975103855,
295
+ "num_tokens": 2209979.0,
296
+ "logits/chosen": -0.2903924655131609,
297
+ "logits/rejected": -0.10041574268765137,
298
+ "mean_token_accuracy": 0.6736215281113982,
299
+ "rewards/chosen": -0.420290390338123,
300
+ "rewards/rejected": -1.1833371208855532,
301
+ "rewards/accuracies": 0.78875,
302
+ "rewards/margins": 0.7630467313993722,
303
+ "logps/chosen": -55.64869555354118,
304
+ "logps/rejected": -56.70225902199745,
305
+ "epoch": 0.1452206835745034,
306
+ "step": 140
307
+ },
308
+ {
309
+ "loss": 0.48405823707580564,
310
+ "grad_norm": 0.009587124921381474,
311
+ "learning_rate": 8.455958549222799e-06,
312
+ "entropy": 1.5990170714166014,
313
+ "num_tokens": 2369571.0,
314
+ "logits/chosen": -0.24899731487552476,
315
+ "logits/rejected": -0.0959463068576649,
316
+ "mean_token_accuracy": 0.6553366997931153,
317
+ "rewards/chosen": -0.3976931418222512,
318
+ "rewards/rejected": -1.2890572238096503,
319
+ "rewards/accuracies": 0.8025,
320
+ "rewards/margins": 0.8913640801142901,
321
+ "logps/chosen": -60.26506376743317,
322
+ "logps/rejected": -59.52328753948212,
323
+ "epoch": 0.1555935895441108,
324
+ "step": 150
325
+ },
326
+ {
327
+ "loss": 0.5164113998413086,
328
+ "grad_norm": 0.009895331226289272,
329
+ "learning_rate": 8.352331606217617e-06,
330
+ "entropy": 1.6323789210617543,
331
+ "num_tokens": 2528769.0,
332
+ "logits/chosen": -0.2223647205235664,
333
+ "logits/rejected": -0.09436181620109207,
334
+ "mean_token_accuracy": 0.6549394633993506,
335
+ "rewards/chosen": -0.5111256973049604,
336
+ "rewards/rejected": -1.2863853847890276,
337
+ "rewards/accuracies": 0.77875,
338
+ "rewards/margins": 0.7752596874302253,
339
+ "logps/chosen": -64.33949285626412,
340
+ "logps/rejected": -59.65175414085388,
341
+ "epoch": 0.16596649551371817,
342
+ "step": 160
343
+ },
344
+ {
345
+ "loss": 0.5000368118286133,
346
+ "grad_norm": 0.008498546667397022,
347
+ "learning_rate": 8.248704663212436e-06,
348
+ "entropy": 1.6361813547555357,
349
+ "num_tokens": 2688485.0,
350
+ "logits/chosen": -0.16995661589474917,
351
+ "logits/rejected": -0.058628515103994625,
352
+ "mean_token_accuracy": 0.6581607956252992,
353
+ "rewards/chosen": -0.4723435838901787,
354
+ "rewards/rejected": -1.3314759727602359,
355
+ "rewards/accuracies": 0.79,
356
+ "rewards/margins": 0.8591323888232,
357
+ "logps/chosen": -63.09673968315124,
358
+ "logps/rejected": -58.408678278923034,
359
+ "epoch": 0.17633940148332555,
360
+ "step": 170
361
+ },
362
+ {
363
+ "loss": 0.48834381103515623,
364
+ "grad_norm": 0.0076238978654146194,
365
+ "learning_rate": 8.145077720207254e-06,
366
+ "entropy": 1.6382397083751856,
367
+ "num_tokens": 2845521.0,
368
+ "logits/chosen": -0.15718930734615982,
369
+ "logits/rejected": -0.05206926899191467,
370
+ "mean_token_accuracy": 0.6570399883762001,
371
+ "rewards/chosen": -0.44634571393646183,
372
+ "rewards/rejected": -1.3426366519206203,
373
+ "rewards/accuracies": 0.80125,
374
+ "rewards/margins": 0.8962909340648912,
375
+ "logps/chosen": -60.25443920731544,
376
+ "logps/rejected": -57.17802233457565,
377
+ "epoch": 0.18671230745293294,
378
+ "step": 180
379
+ },
380
+ {
381
+ "loss": 0.47557435035705564,
382
+ "grad_norm": 0.008195850066840649,
383
+ "learning_rate": 8.041450777202073e-06,
384
+ "entropy": 1.664605896770954,
385
+ "num_tokens": 3002074.0,
386
+ "logits/chosen": -0.18363723049103992,
387
+ "logits/rejected": -0.02745318001992498,
388
+ "mean_token_accuracy": 0.6470572968758642,
389
+ "rewards/chosen": -0.4189180153416373,
390
+ "rewards/rejected": -1.3144572579705618,
391
+ "rewards/accuracies": 0.80625,
392
+ "rewards/margins": 0.895539241922088,
393
+ "logps/chosen": -62.842660636901854,
394
+ "logps/rejected": -55.66383082151413,
395
+ "epoch": 0.19708521342254032,
396
+ "step": 190
397
+ },
398
+ {
399
+ "loss": 0.534032154083252,
400
+ "grad_norm": 0.009718852117657661,
401
+ "learning_rate": 7.937823834196891e-06,
402
+ "entropy": 1.624278563093394,
403
+ "num_tokens": 3158718.0,
404
+ "logits/chosen": -0.1727993139137808,
405
+ "logits/rejected": -0.03551834474392872,
406
+ "mean_token_accuracy": 0.659155095871538,
407
+ "rewards/chosen": -0.4744971431684098,
408
+ "rewards/rejected": -1.2906594037846661,
409
+ "rewards/accuracies": 0.7525,
410
+ "rewards/margins": 0.8161622601863928,
411
+ "logps/chosen": -59.0803443980217,
412
+ "logps/rejected": -56.69621436238289,
413
+ "epoch": 0.2074581193921477,
414
+ "step": 200
415
+ },
416
+ {
417
+ "loss": 0.49621829986572263,
418
+ "grad_norm": 0.006965890992432833,
419
+ "learning_rate": 7.834196891191712e-06,
420
+ "entropy": 1.6065182481892406,
421
+ "num_tokens": 3312685.0,
422
+ "logits/chosen": -0.27075287980432916,
423
+ "logits/rejected": -0.0948328996504896,
424
+ "mean_token_accuracy": 0.655901060551405,
425
+ "rewards/chosen": -0.37993197983159915,
426
+ "rewards/rejected": -1.2266587249445728,
427
+ "rewards/accuracies": 0.7925,
428
+ "rewards/margins": 0.8467267453856766,
429
+ "logps/chosen": -56.4505591404438,
430
+ "logps/rejected": -53.79004474401474,
431
+ "epoch": 0.2178310253617551,
432
+ "step": 210
433
+ },
434
+ {
435
+ "loss": 0.48090167045593263,
436
+ "grad_norm": 0.009547212161123753,
437
+ "learning_rate": 7.730569948186528e-06,
438
+ "entropy": 1.6623543649539352,
439
+ "num_tokens": 3472099.0,
440
+ "logits/chosen": -0.13968818712728476,
441
+ "logits/rejected": 0.0031978122884744786,
442
+ "mean_token_accuracy": 0.6451264442130923,
443
+ "rewards/chosen": -0.482780237980769,
444
+ "rewards/rejected": -1.413478313506348,
445
+ "rewards/accuracies": 0.795,
446
+ "rewards/margins": 0.930698074856773,
447
+ "logps/chosen": -60.84456259608269,
448
+ "logps/rejected": -58.714372800588606,
449
+ "epoch": 0.2282039313313625,
450
+ "step": 220
451
+ },
452
+ {
453
+ "loss": 0.4559622764587402,
454
+ "grad_norm": 0.007603341713547707,
455
+ "learning_rate": 7.626943005181348e-06,
456
+ "entropy": 1.6722249686904251,
457
+ "num_tokens": 3632168.0,
458
+ "logits/chosen": -0.10667086636674211,
459
+ "logits/rejected": -0.022223443209434823,
460
+ "mean_token_accuracy": 0.6569089805148542,
461
+ "rewards/chosen": -0.4016924969325191,
462
+ "rewards/rejected": -1.4414992470349535,
463
+ "rewards/accuracies": 0.8125,
464
+ "rewards/margins": 1.0398067526565864,
465
+ "logps/chosen": -65.72550685882568,
466
+ "logps/rejected": -59.37691457271576,
467
+ "epoch": 0.23857683730096987,
468
+ "step": 230
469
+ },
470
+ {
471
+ "loss": 0.4861691951751709,
472
+ "grad_norm": 0.0118019487708807,
473
+ "learning_rate": 7.523316062176167e-06,
474
+ "entropy": 1.663213079739362,
475
+ "num_tokens": 3790720.0,
476
+ "logits/chosen": -0.084852375856096,
477
+ "logits/rejected": 0.020669056782071628,
478
+ "mean_token_accuracy": 0.6473133432120085,
479
+ "rewards/chosen": -0.48122090814737023,
480
+ "rewards/rejected": -1.4429112731330678,
481
+ "rewards/accuracies": 0.7925,
482
+ "rewards/margins": 0.9616903657466174,
483
+ "logps/chosen": -63.50809263586998,
484
+ "logps/rejected": -59.43233494758606,
485
+ "epoch": 0.24894974327057726,
486
+ "step": 240
487
+ },
488
+ {
489
+ "loss": 0.4908440589904785,
490
+ "grad_norm": 0.009277455508708954,
491
+ "learning_rate": 7.419689119170985e-06,
492
+ "entropy": 1.6366083236783744,
493
+ "num_tokens": 3949401.0,
494
+ "logits/chosen": -0.1602433276424981,
495
+ "logits/rejected": 0.01983137979948086,
496
+ "mean_token_accuracy": 0.6576688695885241,
497
+ "rewards/chosen": -0.4815865662365832,
498
+ "rewards/rejected": -1.3985355464673193,
499
+ "rewards/accuracies": 0.78375,
500
+ "rewards/margins": 0.9169489816110581,
501
+ "logps/chosen": -62.95811867237091,
502
+ "logps/rejected": -59.38419282078743,
503
+ "epoch": 0.2593226492401846,
504
+ "step": 250
505
+ },
506
+ {
507
+ "eval_loss": 0.5700510144233704,
508
+ "eval_runtime": 215.5827,
509
+ "eval_samples_per_second": 4.639,
510
+ "eval_steps_per_second": 4.639,
511
+ "eval_entropy": 1.0522404039800166,
512
+ "eval_num_tokens": 3949401.0,
513
+ "eval_logits/chosen": -0.2592554757373893,
514
+ "eval_logits/rejected": -0.12886324215802,
515
+ "eval_mean_token_accuracy": 0.6999065904319286,
516
+ "eval_rewards/chosen": -0.5199006232493557,
517
+ "eval_rewards/rejected": -1.0152434906987473,
518
+ "eval_rewards/accuracies": 0.689,
519
+ "eval_rewards/margins": 0.4953428685963154,
520
+ "eval_logps/chosen": -55.371993000030514,
521
+ "eval_logps/rejected": -62.79230645370483,
522
+ "epoch": 0.2593226492401846,
523
+ "step": 250
524
+ },
525
+ {
526
+ "loss": 0.5332072734832763,
527
+ "grad_norm": 0.01310813333839178,
528
+ "learning_rate": 7.3160621761658035e-06,
529
+ "entropy": 1.6763470254838466,
530
+ "num_tokens": 4109572.0,
531
+ "logits/chosen": -0.11223109996092892,
532
+ "logits/rejected": 0.00783857225474676,
533
+ "mean_token_accuracy": 0.6527093886770308,
534
+ "rewards/chosen": -0.5290841975083458,
535
+ "rewards/rejected": -1.4143161330505973,
536
+ "rewards/accuracies": 0.76875,
537
+ "rewards/margins": 0.8852319360524415,
538
+ "logps/chosen": -65.61116208314895,
539
+ "logps/rejected": -60.50024994492531,
540
+ "epoch": 0.26969555520979205,
541
+ "step": 260
542
+ },
543
+ {
544
+ "loss": 0.46380929946899413,
545
+ "grad_norm": 0.008016095496714115,
546
+ "learning_rate": 7.212435233160623e-06,
547
+ "entropy": 1.6493263538647442,
548
+ "num_tokens": 4264194.0,
549
+ "logits/chosen": -0.15574262186655452,
550
+ "logits/rejected": -0.00402961174777503,
551
+ "mean_token_accuracy": 0.6535617489926517,
552
+ "rewards/chosen": -0.39940022186754504,
553
+ "rewards/rejected": -1.3337873129447688,
554
+ "rewards/accuracies": 0.80625,
555
+ "rewards/margins": 0.9343870897591114,
556
+ "logps/chosen": -58.40460694432259,
557
+ "logps/rejected": -56.3271455013752,
558
+ "epoch": 0.28006846117939943,
559
+ "step": 270
560
+ },
561
+ {
562
+ "loss": 0.46946086883544924,
563
+ "grad_norm": 0.010439381934702396,
564
+ "learning_rate": 7.108808290155441e-06,
565
+ "entropy": 1.6875111198704689,
566
+ "num_tokens": 4422991.0,
567
+ "logits/chosen": -0.15225440851382163,
568
+ "logits/rejected": -0.012922279572286165,
569
+ "mean_token_accuracy": 0.6428867661487311,
570
+ "rewards/chosen": -0.42678490347389014,
571
+ "rewards/rejected": -1.3960492441387031,
572
+ "rewards/accuracies": 0.815,
573
+ "rewards/margins": 0.9692643392784521,
574
+ "logps/chosen": -63.95781509041786,
575
+ "logps/rejected": -57.44645619392395,
576
+ "epoch": 0.2904413671490068,
577
+ "step": 280
578
+ },
579
+ {
580
+ "loss": 0.4867039680480957,
581
+ "grad_norm": 0.008255927823483944,
582
+ "learning_rate": 7.005181347150259e-06,
583
+ "entropy": 1.6560454944707452,
584
+ "num_tokens": 4582080.0,
585
+ "logits/chosen": -0.12475022342462339,
586
+ "logits/rejected": -0.004146134714328987,
587
+ "mean_token_accuracy": 0.6578386729583144,
588
+ "rewards/chosen": -0.4762678133821464,
589
+ "rewards/rejected": -1.3799970698577817,
590
+ "rewards/accuracies": 0.78875,
591
+ "rewards/margins": 0.9037292560562491,
592
+ "logps/chosen": -62.563043652772905,
593
+ "logps/rejected": -58.98709165453911,
594
+ "epoch": 0.3008142731186142,
595
+ "step": 290
596
+ },
597
+ {
598
+ "loss": 0.46946206092834475,
599
+ "grad_norm": 0.008176690898835659,
600
+ "learning_rate": 6.9015544041450784e-06,
601
+ "entropy": 1.636359941866249,
602
+ "num_tokens": 4740383.0,
603
+ "logits/chosen": -0.14494295129202733,
604
+ "logits/rejected": -0.012990473919638954,
605
+ "mean_token_accuracy": 0.6567367980629206,
606
+ "rewards/chosen": -0.5025469059059469,
607
+ "rewards/rejected": -1.4605811326974072,
608
+ "rewards/accuracies": 0.80125,
609
+ "rewards/margins": 0.9580342254508287,
610
+ "logps/chosen": -61.66068306684494,
611
+ "logps/rejected": -59.60216732621193,
612
+ "epoch": 0.3111871790882216,
613
+ "step": 300
614
+ },
615
+ {
616
+ "loss": 0.4926762580871582,
617
+ "grad_norm": 0.008404894731938839,
618
+ "learning_rate": 6.797927461139897e-06,
619
+ "entropy": 1.6317085930332542,
620
+ "num_tokens": 4901454.0,
621
+ "logits/chosen": -0.10420462296034713,
622
+ "logits/rejected": -0.0032643015884895763,
623
+ "mean_token_accuracy": 0.6517730862647295,
624
+ "rewards/chosen": -0.4740483855601633,
625
+ "rewards/rejected": -1.467887537285569,
626
+ "rewards/accuracies": 0.78625,
627
+ "rewards/margins": 0.9938391536381096,
628
+ "logps/chosen": -62.19328094601631,
629
+ "logps/rejected": -62.36802620172501,
630
+ "epoch": 0.32156008505782896,
631
+ "step": 310
632
+ },
633
+ {
634
+ "loss": 0.4758056640625,
635
+ "grad_norm": 0.01086408831179142,
636
+ "learning_rate": 6.6943005181347155e-06,
637
+ "entropy": 1.6321182049531489,
638
+ "num_tokens": 5058889.0,
639
+ "logits/chosen": -0.1815479056351674,
640
+ "logits/rejected": -0.07081081249938541,
641
+ "mean_token_accuracy": 0.6414232835173607,
642
+ "rewards/chosen": -0.5062945262032008,
643
+ "rewards/rejected": -1.4949601662519854,
644
+ "rewards/accuracies": 0.81,
645
+ "rewards/margins": 0.9886656388547271,
646
+ "logps/chosen": -63.52185977697373,
647
+ "logps/rejected": -59.69021632432938,
648
+ "epoch": 0.33193299102743634,
649
+ "step": 320
650
+ },
651
+ {
652
+ "loss": 0.4784576892852783,
653
+ "grad_norm": 0.010599741712212563,
654
+ "learning_rate": 6.590673575129535e-06,
655
+ "entropy": 1.6721400913968683,
656
+ "num_tokens": 5216549.0,
657
+ "logits/chosen": -0.1229586102306177,
658
+ "logits/rejected": -0.033501552710855156,
659
+ "mean_token_accuracy": 0.639937344957143,
660
+ "rewards/chosen": -0.5294519958324235,
661
+ "rewards/rejected": -1.616222132177645,
662
+ "rewards/accuracies": 0.78,
663
+ "rewards/margins": 1.086770132854581,
664
+ "logps/chosen": -63.12015713572502,
665
+ "logps/rejected": -62.12025535821915,
666
+ "epoch": 0.3423058969970437,
667
+ "step": 330
668
+ },
669
+ {
670
+ "loss": 0.4864365100860596,
671
+ "grad_norm": 0.010677792131900787,
672
+ "learning_rate": 6.487046632124353e-06,
673
+ "entropy": 1.5796756833419203,
674
+ "num_tokens": 5374161.0,
675
+ "logits/chosen": -0.17744578636097688,
676
+ "logits/rejected": -0.08292268708566802,
677
+ "mean_token_accuracy": 0.6436819550767541,
678
+ "rewards/chosen": -0.5906799642526311,
679
+ "rewards/rejected": -1.6022152152087075,
680
+ "rewards/accuracies": 0.78375,
681
+ "rewards/margins": 1.0115352519135923,
682
+ "logps/chosen": -62.16209160447121,
683
+ "logps/rejected": -60.97210006713867,
684
+ "epoch": 0.3526788029666511,
685
+ "step": 340
686
+ },
687
+ {
688
+ "loss": 0.5056374549865723,
689
+ "grad_norm": 0.013692691922187805,
690
+ "learning_rate": 6.383419689119171e-06,
691
+ "entropy": 1.5922023140452801,
692
+ "num_tokens": 5533185.0,
693
+ "logits/chosen": -0.11285970908028921,
694
+ "logits/rejected": -0.018185535407032168,
695
+ "mean_token_accuracy": 0.6443661257252097,
696
+ "rewards/chosen": -0.580222937125145,
697
+ "rewards/rejected": -1.5960858852404636,
698
+ "rewards/accuracies": 0.7725,
699
+ "rewards/margins": 1.0158629460725934,
700
+ "logps/chosen": -64.89270892024041,
701
+ "logps/rejected": -62.29878480195999,
702
+ "epoch": 0.3630517089362585,
703
+ "step": 350
704
+ },
705
+ {
706
+ "loss": 0.48989334106445315,
707
+ "grad_norm": 0.012253508903086185,
708
+ "learning_rate": 6.2797927461139905e-06,
709
+ "entropy": 1.5395906928181649,
710
+ "num_tokens": 5691159.0,
711
+ "logits/chosen": -0.14245793212958643,
712
+ "logits/rejected": -0.015230929526604408,
713
+ "mean_token_accuracy": 0.6611733642220498,
714
+ "rewards/chosen": -0.5437271582013921,
715
+ "rewards/rejected": -1.5548808443109738,
716
+ "rewards/accuracies": 0.7975,
717
+ "rewards/margins": 1.011153682768345,
718
+ "logps/chosen": -60.83840570926666,
719
+ "logps/rejected": -59.6216096830368,
720
+ "epoch": 0.37342461490586587,
721
+ "step": 360
722
+ },
723
+ {
724
+ "loss": 0.48537001609802244,
725
+ "grad_norm": 0.00956793874502182,
726
+ "learning_rate": 6.176165803108809e-06,
727
+ "entropy": 1.6442958949133755,
728
+ "num_tokens": 5850088.0,
729
+ "logits/chosen": -0.058320485277038855,
730
+ "logits/rejected": 0.06270940886949956,
731
+ "mean_token_accuracy": 0.6433443369530142,
732
+ "rewards/chosen": -0.5535192088356417,
733
+ "rewards/rejected": -1.5760743238392751,
734
+ "rewards/accuracies": 0.7975,
735
+ "rewards/margins": 1.0225551136396824,
736
+ "logps/chosen": -66.1269180560112,
737
+ "logps/rejected": -60.73978069186211,
738
+ "epoch": 0.38379752087547325,
739
+ "step": 370
740
+ },
741
+ {
742
+ "eval_loss": 0.5541799664497375,
743
+ "eval_runtime": 245.9984,
744
+ "eval_samples_per_second": 4.065,
745
+ "eval_steps_per_second": 4.065,
746
+ "eval_entropy": 1.0474999970644712,
747
+ "eval_num_tokens": 5928735.0,
748
+ "eval_logits/chosen": -0.23271217653526577,
749
+ "eval_logits/rejected": -0.10208672570441625,
750
+ "eval_mean_token_accuracy": 0.6993389547616243,
751
+ "eval_rewards/chosen": -0.571883928276773,
752
+ "eval_rewards/rejected": -1.1227601580685005,
753
+ "eval_rewards/accuracies": 0.707,
754
+ "eval_rewards/margins": 0.5508762280121445,
755
+ "eval_logps/chosen": -55.89182602119446,
756
+ "eval_logps/rejected": -63.867473125457764,
757
+ "epoch": 0.38898397386027694,
758
+ "step": 375
759
+ },
760
+ {
761
+ "loss": 0.447767972946167,
762
+ "grad_norm": 0.010045935399830341,
763
+ "learning_rate": 6.0725388601036275e-06,
764
+ "entropy": 1.5958718929998577,
765
+ "num_tokens": 6007948.0,
766
+ "logits/chosen": -0.010203895356886221,
767
+ "logits/rejected": 0.0953480252296025,
768
+ "mean_token_accuracy": 0.6510641277581454,
769
+ "rewards/chosen": -0.46026305966945075,
770
+ "rewards/rejected": -1.566630380146671,
771
+ "rewards/accuracies": 0.825,
772
+ "rewards/margins": 1.1063673190772534,
773
+ "logps/chosen": -61.75375435590744,
774
+ "logps/rejected": -58.965001332759854,
775
+ "epoch": 0.39417042684508063,
776
+ "step": 380
777
+ },
778
+ {
779
+ "loss": 0.4722391128540039,
780
+ "grad_norm": 0.010498611256480217,
781
+ "learning_rate": 5.968911917098445e-06,
782
+ "entropy": 1.6217002650536596,
783
+ "num_tokens": 6167000.0,
784
+ "logits/chosen": -0.010942938609718112,
785
+ "logits/rejected": 0.13150225704237622,
786
+ "mean_token_accuracy": 0.6487077697180211,
787
+ "rewards/chosen": -0.4893380562632228,
788
+ "rewards/rejected": -1.546268537521828,
789
+ "rewards/accuracies": 0.79875,
790
+ "rewards/margins": 1.056930480999872,
791
+ "logps/chosen": -63.818650953769684,
792
+ "logps/rejected": -61.81397884130478,
793
+ "epoch": 0.404543332814688,
794
+ "step": 390
795
+ },
796
+ {
797
+ "loss": 0.4782541275024414,
798
+ "grad_norm": 0.009464209899306297,
799
+ "learning_rate": 5.865284974093265e-06,
800
+ "entropy": 1.6495763343665748,
801
+ "num_tokens": 6325205.0,
802
+ "logits/chosen": -0.011458384051150232,
803
+ "logits/rejected": 0.09236410504123445,
804
+ "mean_token_accuracy": 0.6448470102529973,
805
+ "rewards/chosen": -0.51347439962934,
806
+ "rewards/rejected": -1.5123917219531722,
807
+ "rewards/accuracies": 0.79125,
808
+ "rewards/margins": 0.9989173209294677,
809
+ "logps/chosen": -63.590197974443434,
810
+ "logps/rejected": -61.28543629407883,
811
+ "epoch": 0.4149162387842954,
812
+ "step": 400
813
+ },
814
+ {
815
+ "loss": 0.4769914627075195,
816
+ "grad_norm": 0.011201824992895126,
817
+ "learning_rate": 5.761658031088083e-06,
818
+ "entropy": 1.6099769476987422,
819
+ "num_tokens": 6483981.0,
820
+ "logits/chosen": -0.008573553675108867,
821
+ "logits/rejected": 0.10661449974217808,
822
+ "mean_token_accuracy": 0.6476613377220929,
823
+ "rewards/chosen": -0.5158215398409811,
824
+ "rewards/rejected": -1.5142960718111136,
825
+ "rewards/accuracies": 0.795,
826
+ "rewards/margins": 0.9984745322261006,
827
+ "logps/chosen": -62.939886302948,
828
+ "logps/rejected": -60.21168664813042,
829
+ "epoch": 0.4252891447539028,
830
+ "step": 410
831
+ },
832
+ {
833
+ "loss": 0.4447061061859131,
834
+ "grad_norm": 0.01015845313668251,
835
+ "learning_rate": 5.658031088082902e-06,
836
+ "entropy": 1.6073184362612665,
837
+ "num_tokens": 6642561.0,
838
+ "logits/chosen": 0.007230915169619996,
839
+ "logits/rejected": 0.10328242233161539,
840
+ "mean_token_accuracy": 0.6508273026905954,
841
+ "rewards/chosen": -0.4930744762084214,
842
+ "rewards/rejected": -1.6134738429238495,
843
+ "rewards/accuracies": 0.82,
844
+ "rewards/margins": 1.1203993632458151,
845
+ "logps/chosen": -65.08479910731316,
846
+ "logps/rejected": -60.65289543390274,
847
+ "epoch": 0.4356620507235102,
848
+ "step": 420
849
+ },
850
+ {
851
+ "loss": 0.44136753082275393,
852
+ "grad_norm": 0.008634388446807861,
853
+ "learning_rate": 5.554404145077721e-06,
854
+ "entropy": 1.62525453383103,
855
+ "num_tokens": 6802172.0,
856
+ "logits/chosen": 0.09677644223113024,
857
+ "logits/rejected": 0.19686068222909975,
858
+ "mean_token_accuracy": 0.6414820049889386,
859
+ "rewards/chosen": -0.530476398501778,
860
+ "rewards/rejected": -1.7060055632909643,
861
+ "rewards/accuracies": 0.815,
862
+ "rewards/margins": 1.1755291634099558,
863
+ "logps/chosen": -63.63275898098946,
864
+ "logps/rejected": -61.548430292606355,
865
+ "epoch": 0.4460349566931176,
866
+ "step": 430
867
+ },
868
+ {
869
+ "loss": 0.44923830032348633,
870
+ "grad_norm": 0.011443796567618847,
871
+ "learning_rate": 5.4507772020725395e-06,
872
+ "entropy": 1.6008457892294974,
873
+ "num_tokens": 6960698.0,
874
+ "logits/chosen": 0.03864486058133284,
875
+ "logits/rejected": 0.16183756452396064,
876
+ "mean_token_accuracy": 0.6556359087582677,
877
+ "rewards/chosen": -0.5446211060311179,
878
+ "rewards/rejected": -1.6678383790072986,
879
+ "rewards/accuracies": 0.8275,
880
+ "rewards/margins": 1.1232172738574446,
881
+ "logps/chosen": -61.80046648740768,
882
+ "logps/rejected": -60.58844954848289,
883
+ "epoch": 0.456407862662725,
884
+ "step": 440
885
+ },
886
+ {
887
+ "loss": 0.4775514602661133,
888
+ "grad_norm": 0.015888305380940437,
889
+ "learning_rate": 5.347150259067357e-06,
890
+ "entropy": 1.6431135883461685,
891
+ "num_tokens": 7120292.0,
892
+ "logits/chosen": 0.058064731861634356,
893
+ "logits/rejected": 0.2062258352022907,
894
+ "mean_token_accuracy": 0.6481080191396177,
895
+ "rewards/chosen": -0.5665322134363828,
896
+ "rewards/rejected": -1.696948098014691,
897
+ "rewards/accuracies": 0.79375,
898
+ "rewards/margins": 1.1304158817767165,
899
+ "logps/chosen": -62.31974795341492,
900
+ "logps/rejected": -62.94689394712448,
901
+ "epoch": 0.46678076863233237,
902
+ "step": 450
903
+ },
904
+ {
905
+ "loss": 0.45407419204711913,
906
+ "grad_norm": 0.011245348490774632,
907
+ "learning_rate": 5.243523316062177e-06,
908
+ "entropy": 1.6142372595332564,
909
+ "num_tokens": 7277503.0,
910
+ "logits/chosen": 0.027211253980977537,
911
+ "logits/rejected": 0.14270901371261632,
912
+ "mean_token_accuracy": 0.6483659755066037,
913
+ "rewards/chosen": -0.5206575704316492,
914
+ "rewards/rejected": -1.627284916813951,
915
+ "rewards/accuracies": 0.82875,
916
+ "rewards/margins": 1.1066273492295295,
917
+ "logps/chosen": -62.51640429496765,
918
+ "logps/rejected": -59.92736347913742,
919
+ "epoch": 0.47715367460193975,
920
+ "step": 460
921
+ },
922
+ {
923
+ "loss": 0.4705537796020508,
924
+ "grad_norm": 0.017906704917550087,
925
+ "learning_rate": 5.139896373056995e-06,
926
+ "entropy": 1.6305865264125168,
927
+ "num_tokens": 7433576.0,
928
+ "logits/chosen": -0.01868226836908457,
929
+ "logits/rejected": 0.10559852450806628,
930
+ "mean_token_accuracy": 0.6382040186412632,
931
+ "rewards/chosen": -0.5739967311238433,
932
+ "rewards/rejected": -1.6218135237134994,
933
+ "rewards/accuracies": 0.78125,
934
+ "rewards/margins": 1.0478167911106722,
935
+ "logps/chosen": -61.798225450515744,
936
+ "logps/rejected": -59.17569625377655,
937
+ "epoch": 0.48752658057154713,
938
+ "step": 470
939
+ },
940
+ {
941
+ "loss": 0.44884982109069826,
942
+ "grad_norm": 0.009567538276314735,
943
+ "learning_rate": 5.036269430051814e-06,
944
+ "entropy": 1.6556390350870789,
945
+ "num_tokens": 7593962.0,
946
+ "logits/chosen": 0.02396342091178786,
947
+ "logits/rejected": 0.15151965562177133,
948
+ "mean_token_accuracy": 0.6423015125840902,
949
+ "rewards/chosen": -0.6105934929932119,
950
+ "rewards/rejected": -1.7286542325050687,
951
+ "rewards/accuracies": 0.79875,
952
+ "rewards/margins": 1.1180607356689871,
953
+ "logps/chosen": -65.96984986424447,
954
+ "logps/rejected": -63.567516083717344,
955
+ "epoch": 0.4978994865411545,
956
+ "step": 480
957
+ },
958
+ {
959
+ "loss": 0.46419124603271483,
960
+ "grad_norm": 0.010610009543597698,
961
+ "learning_rate": 4.932642487046633e-06,
962
+ "entropy": 1.63694656169042,
963
+ "num_tokens": 7753841.0,
964
+ "logits/chosen": 0.05542139131963341,
965
+ "logits/rejected": 0.1531588473091942,
966
+ "mean_token_accuracy": 0.6532461035437882,
967
+ "rewards/chosen": -0.6174891357401794,
968
+ "rewards/rejected": -1.7478586566343437,
969
+ "rewards/accuracies": 0.8125,
970
+ "rewards/margins": 1.130369521221146,
971
+ "logps/chosen": -63.278802993297575,
972
+ "logps/rejected": -63.9350430393219,
973
+ "epoch": 0.5082723925107618,
974
+ "step": 490
975
+ },
976
+ {
977
+ "loss": 0.4718832015991211,
978
+ "grad_norm": 0.01074894331395626,
979
+ "learning_rate": 4.829015544041451e-06,
980
+ "entropy": 1.6344914321228863,
981
+ "num_tokens": 7911511.0,
982
+ "logits/chosen": 0.039370719731205275,
983
+ "logits/rejected": 0.16598465687796668,
984
+ "mean_token_accuracy": 0.6492240923829377,
985
+ "rewards/chosen": -0.5642123090758104,
986
+ "rewards/rejected": -1.6763065649938653,
987
+ "rewards/accuracies": 0.78625,
988
+ "rewards/margins": 1.1120942557882518,
989
+ "logps/chosen": -61.73503879547119,
990
+ "logps/rejected": -62.51426592111588,
991
+ "epoch": 0.5186452984803692,
992
+ "step": 500
993
+ },
994
+ {
995
+ "eval_loss": 0.5400257706642151,
996
+ "eval_runtime": 278.2919,
997
+ "eval_samples_per_second": 3.593,
998
+ "eval_steps_per_second": 3.593,
999
+ "eval_entropy": 1.0458819408267737,
1000
+ "eval_num_tokens": 7911511.0,
1001
+ "eval_logits/chosen": -0.1978596412920271,
1002
+ "eval_logits/rejected": -0.06171821412221096,
1003
+ "eval_mean_token_accuracy": 0.6972633041292429,
1004
+ "eval_rewards/chosen": -0.6398490693312487,
1005
+ "eval_rewards/rejected": -1.2539186353033873,
1006
+ "eval_rewards/accuracies": 0.727,
1007
+ "eval_rewards/margins": 0.6140695666372776,
1008
+ "eval_logps/chosen": -56.57147743225098,
1009
+ "eval_logps/rejected": -65.17905788230895,
1010
+ "epoch": 0.5186452984803692,
1011
+ "step": 500
1012
+ },
1013
+ {
1014
+ "loss": 0.4755256175994873,
1015
+ "grad_norm": 0.011379857547581196,
1016
+ "learning_rate": 4.72538860103627e-06,
1017
+ "entropy": 1.6379237968847156,
1018
+ "num_tokens": 8070081.0,
1019
+ "logits/chosen": 0.08480375218267698,
1020
+ "logits/rejected": 0.18248930696878024,
1021
+ "mean_token_accuracy": 0.6486436153575778,
1022
+ "rewards/chosen": -0.6162076763511868,
1023
+ "rewards/rejected": -1.6715471999935108,
1024
+ "rewards/accuracies": 0.80625,
1025
+ "rewards/margins": 1.0553395241731778,
1026
+ "logps/chosen": -64.42356903076171,
1027
+ "logps/rejected": -59.52313063383102,
1028
+ "epoch": 0.5290182044499767,
1029
+ "step": 510
1030
+ },
1031
+ {
1032
+ "loss": 0.4912434101104736,
1033
+ "grad_norm": 0.009543896652758121,
1034
+ "learning_rate": 4.621761658031089e-06,
1035
+ "entropy": 1.62886246021837,
1036
+ "num_tokens": 8226032.0,
1037
+ "logits/chosen": 0.04373571989101422,
1038
+ "logits/rejected": 0.1632708972191895,
1039
+ "mean_token_accuracy": 0.6450024632364512,
1040
+ "rewards/chosen": -0.5994134752946411,
1041
+ "rewards/rejected": -1.5973126511012379,
1042
+ "rewards/accuracies": 0.79,
1043
+ "rewards/margins": 0.9978991763386875,
1044
+ "logps/chosen": -61.06594479799271,
1045
+ "logps/rejected": -59.51982655286789,
1046
+ "epoch": 0.5393911104195841,
1047
+ "step": 520
1048
+ },
1049
+ {
1050
+ "loss": 0.4588636875152588,
1051
+ "grad_norm": 0.010315664112567902,
1052
+ "learning_rate": 4.518134715025907e-06,
1053
+ "entropy": 1.6835303687490524,
1054
+ "num_tokens": 8384377.0,
1055
+ "logits/chosen": 0.06022681958823317,
1056
+ "logits/rejected": 0.182036032657229,
1057
+ "mean_token_accuracy": 0.63875184844248,
1058
+ "rewards/chosen": -0.5799533515534131,
1059
+ "rewards/rejected": -1.7233658448676579,
1060
+ "rewards/accuracies": 0.80875,
1061
+ "rewards/margins": 1.143412495199591,
1062
+ "logps/chosen": -64.0477586555481,
1063
+ "logps/rejected": -62.54838394999504,
1064
+ "epoch": 0.5497640163891915,
1065
+ "step": 530
1066
+ },
1067
+ {
1068
+ "loss": 0.4572054386138916,
1069
+ "grad_norm": 0.01254233904182911,
1070
+ "learning_rate": 4.414507772020726e-06,
1071
+ "entropy": 1.6456316580064594,
1072
+ "num_tokens": 8543279.0,
1073
+ "logits/chosen": 0.06499475886537846,
1074
+ "logits/rejected": 0.19926284731697655,
1075
+ "mean_token_accuracy": 0.6476211673207581,
1076
+ "rewards/chosen": -0.6441993828896193,
1077
+ "rewards/rejected": -1.7510575192118996,
1078
+ "rewards/accuracies": 0.83,
1079
+ "rewards/margins": 1.106858134865761,
1080
+ "logps/chosen": -62.7225538957119,
1081
+ "logps/rejected": -62.64689356803894,
1082
+ "epoch": 0.5601369223587989,
1083
+ "step": 540
1084
+ },
1085
+ {
1086
+ "loss": 0.46482481956481936,
1087
+ "grad_norm": 0.033692456781864166,
1088
+ "learning_rate": 4.310880829015544e-06,
1089
+ "entropy": 1.694882277622819,
1090
+ "num_tokens": 8703115.0,
1091
+ "logits/chosen": 0.15109038640147246,
1092
+ "logits/rejected": 0.2297669311708141,
1093
+ "mean_token_accuracy": 0.6399877128005028,
1094
+ "rewards/chosen": -0.661507485556067,
1095
+ "rewards/rejected": -1.8317748800176197,
1096
+ "rewards/accuracies": 0.79875,
1097
+ "rewards/margins": 1.170267395619303,
1098
+ "logps/chosen": -66.47220434308052,
1099
+ "logps/rejected": -66.16992118120193,
1100
+ "epoch": 0.5705098283284062,
1101
+ "step": 550
1102
+ },
1103
+ {
1104
+ "loss": 0.46529335975646974,
1105
+ "grad_norm": 0.012274126522243023,
1106
+ "learning_rate": 4.207253886010363e-06,
1107
+ "entropy": 1.6411442287266254,
1108
+ "num_tokens": 8862439.0,
1109
+ "logits/chosen": 0.07749967645058822,
1110
+ "logits/rejected": 0.17964104042378107,
1111
+ "mean_token_accuracy": 0.6407143748924136,
1112
+ "rewards/chosen": -0.6461584532729012,
1113
+ "rewards/rejected": -1.7939777009031967,
1114
+ "rewards/accuracies": 0.8,
1115
+ "rewards/margins": 1.1478192471479998,
1116
+ "logps/chosen": -64.53955813646317,
1117
+ "logps/rejected": -62.56636171579361,
1118
+ "epoch": 0.5808827342980136,
1119
+ "step": 560
1120
+ },
1121
+ {
1122
+ "loss": 0.4430724620819092,
1123
+ "grad_norm": 0.014654034748673439,
1124
+ "learning_rate": 4.103626943005182e-06,
1125
+ "entropy": 1.641110150022432,
1126
+ "num_tokens": 9019532.0,
1127
+ "logits/chosen": 0.1006488560296452,
1128
+ "logits/rejected": 0.21211194322628596,
1129
+ "mean_token_accuracy": 0.6409156301990151,
1130
+ "rewards/chosen": -0.6455532481150612,
1131
+ "rewards/rejected": -1.7706630855146797,
1132
+ "rewards/accuracies": 0.835,
1133
+ "rewards/margins": 1.1251098392903804,
1134
+ "logps/chosen": -63.84049278497696,
1135
+ "logps/rejected": -60.347349853515624,
1136
+ "epoch": 0.591255640267621,
1137
+ "step": 570
1138
+ },
1139
+ {
1140
+ "loss": 0.46980915069580076,
1141
+ "grad_norm": 0.015018550679087639,
1142
+ "learning_rate": 4.000000000000001e-06,
1143
+ "entropy": 1.6142543618567289,
1144
+ "num_tokens": 9176151.0,
1145
+ "logits/chosen": 0.008260599334212472,
1146
+ "logits/rejected": 0.13603789421792953,
1147
+ "mean_token_accuracy": 0.6421346751507372,
1148
+ "rewards/chosen": -0.6516643855780512,
1149
+ "rewards/rejected": -1.7954043288715185,
1150
+ "rewards/accuracies": 0.805,
1151
+ "rewards/margins": 1.14373994121328,
1152
+ "logps/chosen": -61.326625975370405,
1153
+ "logps/rejected": -61.17676810503006,
1154
+ "epoch": 0.6016285462372284,
1155
+ "step": 580
1156
+ },
1157
+ {
1158
+ "loss": 0.5050342559814454,
1159
+ "grad_norm": 0.018550831824541092,
1160
+ "learning_rate": 3.896373056994819e-06,
1161
+ "entropy": 1.6450188556872307,
1162
+ "num_tokens": 9335435.0,
1163
+ "logits/chosen": 0.03664537931858989,
1164
+ "logits/rejected": 0.1512234776259551,
1165
+ "mean_token_accuracy": 0.6435695023182779,
1166
+ "rewards/chosen": -0.7144207920093322,
1167
+ "rewards/rejected": -1.727617413054686,
1168
+ "rewards/accuracies": 0.77375,
1169
+ "rewards/margins": 1.013196619511582,
1170
+ "logps/chosen": -65.46060695648194,
1171
+ "logps/rejected": -63.5906271135807,
1172
+ "epoch": 0.6120014522068358,
1173
+ "step": 590
1174
+ },
1175
+ {
1176
+ "loss": 0.4836301326751709,
1177
+ "grad_norm": 0.016474206000566483,
1178
+ "learning_rate": 3.7927461139896377e-06,
1179
+ "entropy": 1.6528891836851836,
1180
+ "num_tokens": 9491363.0,
1181
+ "logits/chosen": 0.08386782463631755,
1182
+ "logits/rejected": 0.20943303131643703,
1183
+ "mean_token_accuracy": 0.6487930232100189,
1184
+ "rewards/chosen": -0.6163708032899012,
1185
+ "rewards/rejected": -1.6733668212150223,
1186
+ "rewards/accuracies": 0.78375,
1187
+ "rewards/margins": 1.0569960164930672,
1188
+ "logps/chosen": -60.280444753170016,
1189
+ "logps/rejected": -61.18290127515793,
1190
+ "epoch": 0.6223743581764432,
1191
+ "step": 600
1192
+ },
1193
+ {
1194
+ "loss": 0.4617151260375977,
1195
+ "grad_norm": 0.010820780880749226,
1196
+ "learning_rate": 3.6891191709844567e-06,
1197
+ "entropy": 1.6939242084044963,
1198
+ "num_tokens": 9648643.0,
1199
+ "logits/chosen": 0.09977307296605359,
1200
+ "logits/rejected": 0.20379420233565199,
1201
+ "mean_token_accuracy": 0.6439293037727475,
1202
+ "rewards/chosen": -0.6212675093274447,
1203
+ "rewards/rejected": -1.7044480502128136,
1204
+ "rewards/accuracies": 0.82,
1205
+ "rewards/margins": 1.0831805411481765,
1206
+ "logps/chosen": -60.97681099057198,
1207
+ "logps/rejected": -62.301487598419186,
1208
+ "epoch": 0.6327472641460505,
1209
+ "step": 610
1210
+ },
1211
+ {
1212
+ "loss": 0.45804176330566404,
1213
+ "grad_norm": 0.012919292785227299,
1214
+ "learning_rate": 3.5854922279792748e-06,
1215
+ "entropy": 1.619003531029448,
1216
+ "num_tokens": 9806029.0,
1217
+ "logits/chosen": 0.0483610800015232,
1218
+ "logits/rejected": 0.1797610236274009,
1219
+ "mean_token_accuracy": 0.6475096028484404,
1220
+ "rewards/chosen": -0.5888219272701827,
1221
+ "rewards/rejected": -1.706802941111964,
1222
+ "rewards/accuracies": 0.8075,
1223
+ "rewards/margins": 1.1179810122167693,
1224
+ "logps/chosen": -59.50200087547302,
1225
+ "logps/rejected": -61.049637752771375,
1226
+ "epoch": 0.6431201701156579,
1227
+ "step": 620
1228
+ },
1229
+ {
1230
+ "eval_loss": 0.5324422717094421,
1231
+ "eval_runtime": 288.7421,
1232
+ "eval_samples_per_second": 3.463,
1233
+ "eval_steps_per_second": 3.463,
1234
+ "eval_entropy": 1.0448875862136484,
1235
+ "eval_num_tokens": 9884893.0,
1236
+ "eval_logits/chosen": -0.19975289350595532,
1237
+ "eval_logits/rejected": -0.060755203565891945,
1238
+ "eval_mean_token_accuracy": 0.6964090894907713,
1239
+ "eval_rewards/chosen": -0.6912122842722456,
1240
+ "eval_rewards/rejected": -1.345464039585553,
1241
+ "eval_rewards/accuracies": 0.736,
1242
+ "eval_rewards/margins": 0.6542517534568906,
1243
+ "eval_logps/chosen": -57.08510956954956,
1244
+ "eval_logps/rejected": -66.09451188468933,
1245
+ "epoch": 0.6483066231004616,
1246
+ "step": 625
1247
+ },
1248
+ {
1249
+ "loss": 0.45544919967651365,
1250
+ "grad_norm": 0.010571232065558434,
1251
+ "learning_rate": 3.4818652849740937e-06,
1252
+ "entropy": 1.6706199841760099,
1253
+ "num_tokens": 9965103.0,
1254
+ "logits/chosen": 0.1180553175480971,
1255
+ "logits/rejected": 0.21143161932841895,
1256
+ "mean_token_accuracy": 0.6404067935794592,
1257
+ "rewards/chosen": -0.6081898983999418,
1258
+ "rewards/rejected": -1.7734553063547356,
1259
+ "rewards/accuracies": 0.81,
1260
+ "rewards/margins": 1.1652654066774994,
1261
+ "logps/chosen": -62.56314527273178,
1262
+ "logps/rejected": -63.61036643981934,
1263
+ "epoch": 0.6534930760852653,
1264
+ "step": 630
1265
+ },
1266
+ {
1267
+ "loss": 0.44363651275634763,
1268
+ "grad_norm": 0.011373443529009819,
1269
+ "learning_rate": 3.3782383419689123e-06,
1270
+ "entropy": 1.661266395803541,
1271
+ "num_tokens": 10122828.0,
1272
+ "logits/chosen": 0.13310990911343398,
1273
+ "logits/rejected": 0.2430608346820568,
1274
+ "mean_token_accuracy": 0.6414054480008781,
1275
+ "rewards/chosen": -0.645503295796052,
1276
+ "rewards/rejected": -1.7806003371396217,
1277
+ "rewards/accuracies": 0.81,
1278
+ "rewards/margins": 1.1350970419961959,
1279
+ "logps/chosen": -61.5342090690136,
1280
+ "logps/rejected": -63.98482904434204,
1281
+ "epoch": 0.6638659820548727,
1282
+ "step": 640
1283
+ },
1284
+ {
1285
+ "loss": 0.4796154499053955,
1286
+ "grad_norm": 0.012532204389572144,
1287
+ "learning_rate": 3.274611398963731e-06,
1288
+ "entropy": 1.6701466926187276,
1289
+ "num_tokens": 10279859.0,
1290
+ "logits/chosen": 0.07329429847103937,
1291
+ "logits/rejected": 0.1878599203293891,
1292
+ "mean_token_accuracy": 0.6414687449485064,
1293
+ "rewards/chosen": -0.661306283445374,
1294
+ "rewards/rejected": -1.7610867334110663,
1295
+ "rewards/accuracies": 0.80375,
1296
+ "rewards/margins": 1.099780449680984,
1297
+ "logps/chosen": -62.595525816679,
1298
+ "logps/rejected": -61.356811988353726,
1299
+ "epoch": 0.6742388880244801,
1300
+ "step": 650
1301
+ },
1302
+ {
1303
+ "loss": 0.4748543739318848,
1304
+ "grad_norm": 0.01547182071954012,
1305
+ "learning_rate": 3.1709844559585493e-06,
1306
+ "entropy": 1.6658864275645464,
1307
+ "num_tokens": 10436075.0,
1308
+ "logits/chosen": 0.10011936781303017,
1309
+ "logits/rejected": 0.2041365355242361,
1310
+ "mean_token_accuracy": 0.6389276959933341,
1311
+ "rewards/chosen": -0.6364252381109691,
1312
+ "rewards/rejected": -1.735760998390615,
1313
+ "rewards/accuracies": 0.80625,
1314
+ "rewards/margins": 1.099335762821138,
1315
+ "logps/chosen": -61.83362093210221,
1316
+ "logps/rejected": -61.003912779092786,
1317
+ "epoch": 0.6846117939940874,
1318
+ "step": 660
1319
+ },
1320
+ {
1321
+ "loss": 0.4296245098114014,
1322
+ "grad_norm": 0.011170756071805954,
1323
+ "learning_rate": 3.0673575129533683e-06,
1324
+ "entropy": 1.6508124286774546,
1325
+ "num_tokens": 10594936.0,
1326
+ "logits/chosen": 0.10534840408886,
1327
+ "logits/rejected": 0.20408601168915652,
1328
+ "mean_token_accuracy": 0.6367748867347837,
1329
+ "rewards/chosen": -0.6433876353609412,
1330
+ "rewards/rejected": -1.8510402401175816,
1331
+ "rewards/accuracies": 0.8175,
1332
+ "rewards/margins": 1.2076526060514152,
1333
+ "logps/chosen": -64.62543644189834,
1334
+ "logps/rejected": -62.8101417517662,
1335
+ "epoch": 0.6949846999636948,
1336
+ "step": 670
1337
+ },
1338
+ {
1339
+ "loss": 0.4698948383331299,
1340
+ "grad_norm": 0.019366616383194923,
1341
+ "learning_rate": 2.963730569948187e-06,
1342
+ "entropy": 1.6687841359246522,
1343
+ "num_tokens": 10754603.0,
1344
+ "logits/chosen": 0.13530835426877952,
1345
+ "logits/rejected": 0.25161180215337653,
1346
+ "mean_token_accuracy": 0.6364573692902923,
1347
+ "rewards/chosen": -0.6632168094060035,
1348
+ "rewards/rejected": -1.8288732153433376,
1349
+ "rewards/accuracies": 0.79875,
1350
+ "rewards/margins": 1.165656405221671,
1351
+ "logps/chosen": -65.38578713893891,
1352
+ "logps/rejected": -64.20987098813058,
1353
+ "epoch": 0.7053576059333022,
1354
+ "step": 680
1355
+ },
1356
+ {
1357
+ "loss": 0.5016210079193115,
1358
+ "grad_norm": 0.022646328434348106,
1359
+ "learning_rate": 2.8601036269430053e-06,
1360
+ "entropy": 1.711660223044455,
1361
+ "num_tokens": 10913690.0,
1362
+ "logits/chosen": 0.16971737857777713,
1363
+ "logits/rejected": 0.2760859463634132,
1364
+ "mean_token_accuracy": 0.6390431644208729,
1365
+ "rewards/chosen": -0.6508824050683597,
1366
+ "rewards/rejected": -1.6932820503300172,
1367
+ "rewards/accuracies": 0.79375,
1368
+ "rewards/margins": 1.0423996420949697,
1369
+ "logps/chosen": -66.28588567495346,
1370
+ "logps/rejected": -62.060355219841,
1371
+ "epoch": 0.7157305119029096,
1372
+ "step": 690
1373
+ },
1374
+ {
1375
+ "loss": 0.43436241149902344,
1376
+ "grad_norm": 0.009509176947176456,
1377
+ "learning_rate": 2.7564766839378243e-06,
1378
+ "entropy": 1.6765110883302987,
1379
+ "num_tokens": 11071134.0,
1380
+ "logits/chosen": 0.12124103042581971,
1381
+ "logits/rejected": 0.2600804952933655,
1382
+ "mean_token_accuracy": 0.6427443787083029,
1383
+ "rewards/chosen": -0.5906095821626696,
1384
+ "rewards/rejected": -1.720989261372597,
1385
+ "rewards/accuracies": 0.835,
1386
+ "rewards/margins": 1.130379677421879,
1387
+ "logps/chosen": -63.95436416387558,
1388
+ "logps/rejected": -59.14868986845016,
1389
+ "epoch": 0.726103417872517,
1390
+ "step": 700
1391
+ },
1392
+ {
1393
+ "loss": 0.4556713581085205,
1394
+ "grad_norm": 0.01146204024553299,
1395
+ "learning_rate": 2.6528497409326424e-06,
1396
+ "entropy": 1.6694943796936423,
1397
+ "num_tokens": 11230405.0,
1398
+ "logits/chosen": 0.07533675440714994,
1399
+ "logits/rejected": 0.19347860103992787,
1400
+ "mean_token_accuracy": 0.6436189501732588,
1401
+ "rewards/chosen": -0.5904611392628294,
1402
+ "rewards/rejected": -1.7462449892124277,
1403
+ "rewards/accuracies": 0.8025,
1404
+ "rewards/margins": 1.155783847218845,
1405
+ "logps/chosen": -66.84839742302894,
1406
+ "logps/rejected": -61.99807296037674,
1407
+ "epoch": 0.7364763238421244,
1408
+ "step": 710
1409
+ },
1410
+ {
1411
+ "loss": 0.4577175140380859,
1412
+ "grad_norm": 0.012849503196775913,
1413
+ "learning_rate": 2.5492227979274614e-06,
1414
+ "entropy": 1.6657723085489125,
1415
+ "num_tokens": 11386296.0,
1416
+ "logits/chosen": 0.05922319803504693,
1417
+ "logits/rejected": 0.17808647771296027,
1418
+ "mean_token_accuracy": 0.6431331102643162,
1419
+ "rewards/chosen": -0.5677624635772373,
1420
+ "rewards/rejected": -1.6767527183049242,
1421
+ "rewards/accuracies": 0.8225,
1422
+ "rewards/margins": 1.1089902543462813,
1423
+ "logps/chosen": -61.68554986834526,
1424
+ "logps/rejected": -58.83755177259445,
1425
+ "epoch": 0.7468492298117317,
1426
+ "step": 720
1427
+ },
1428
+ {
1429
+ "loss": 0.4547234535217285,
1430
+ "grad_norm": 0.014395375736057758,
1431
+ "learning_rate": 2.44559585492228e-06,
1432
+ "entropy": 1.6862239858694374,
1433
+ "num_tokens": 11546081.0,
1434
+ "logits/chosen": 0.1350684718563505,
1435
+ "logits/rejected": 0.2427451158459563,
1436
+ "mean_token_accuracy": 0.64147017583251,
1437
+ "rewards/chosen": -0.5967396693397313,
1438
+ "rewards/rejected": -1.765362592941492,
1439
+ "rewards/accuracies": 0.80375,
1440
+ "rewards/margins": 1.1686229225434364,
1441
+ "logps/chosen": -63.325855791568756,
1442
+ "logps/rejected": -65.51477008223533,
1443
+ "epoch": 0.7572221357813391,
1444
+ "step": 730
1445
+ },
1446
+ {
1447
+ "loss": 0.4426294803619385,
1448
+ "grad_norm": 0.012110771611332893,
1449
+ "learning_rate": 2.3419689119170984e-06,
1450
+ "entropy": 1.707785174669698,
1451
+ "num_tokens": 11703833.0,
1452
+ "logits/chosen": 0.0927098814711561,
1453
+ "logits/rejected": 0.23603759404490104,
1454
+ "mean_token_accuracy": 0.6414807749167085,
1455
+ "rewards/chosen": -0.5864860777647118,
1456
+ "rewards/rejected": -1.7438211480446626,
1457
+ "rewards/accuracies": 0.83125,
1458
+ "rewards/margins": 1.1573350698873401,
1459
+ "logps/chosen": -63.334676113128666,
1460
+ "logps/rejected": -63.40963178634644,
1461
+ "epoch": 0.7675950417509465,
1462
+ "step": 740
1463
+ },
1464
+ {
1465
+ "loss": 0.46600141525268557,
1466
+ "grad_norm": 0.013532786630094051,
1467
+ "learning_rate": 2.2383419689119174e-06,
1468
+ "entropy": 1.6768190996162593,
1469
+ "num_tokens": 11865175.0,
1470
+ "logits/chosen": 0.1273617797525129,
1471
+ "logits/rejected": 0.22872866333573835,
1472
+ "mean_token_accuracy": 0.642769878860563,
1473
+ "rewards/chosen": -0.6710381170455002,
1474
+ "rewards/rejected": -1.8427071001776494,
1475
+ "rewards/accuracies": 0.805,
1476
+ "rewards/margins": 1.1716689813882113,
1477
+ "logps/chosen": -66.42985866189002,
1478
+ "logps/rejected": -66.3072749710083,
1479
+ "epoch": 0.7779679477205539,
1480
+ "step": 750
1481
+ },
1482
+ {
1483
+ "eval_loss": 0.5291131734848022,
1484
+ "eval_runtime": 316.7312,
1485
+ "eval_samples_per_second": 3.157,
1486
+ "eval_steps_per_second": 3.157,
1487
+ "eval_entropy": 1.0425387567952276,
1488
+ "eval_num_tokens": 11865175.0,
1489
+ "eval_logits/chosen": -0.19368413704948595,
1490
+ "eval_logits/rejected": -0.05676454023564469,
1491
+ "eval_mean_token_accuracy": 0.6966218997985124,
1492
+ "eval_rewards/chosen": -0.6922309857774526,
1493
+ "eval_rewards/rejected": -1.3544460057471879,
1494
+ "eval_rewards/accuracies": 0.747,
1495
+ "eval_rewards/margins": 0.6622150189429522,
1496
+ "eval_logps/chosen": -57.09529658699036,
1497
+ "eval_logps/rejected": -66.18433157348633,
1498
+ "epoch": 0.7779679477205539,
1499
+ "step": 750
1500
+ },
1501
+ {
1502
+ "loss": 0.43166389465332033,
1503
+ "grad_norm": 0.012500453740358353,
1504
+ "learning_rate": 2.134715025906736e-06,
1505
+ "entropy": 1.6828834046982228,
1506
+ "num_tokens": 12024093.0,
1507
+ "logits/chosen": 0.09826941010263189,
1508
+ "logits/rejected": 0.215735024556398,
1509
+ "mean_token_accuracy": 0.6342808033898473,
1510
+ "rewards/chosen": -0.6309049091633642,
1511
+ "rewards/rejected": -1.7712371364238242,
1512
+ "rewards/accuracies": 0.815,
1513
+ "rewards/margins": 1.1403322232328355,
1514
+ "logps/chosen": -64.024556722641,
1515
+ "logps/rejected": -62.57202324867249,
1516
+ "epoch": 0.7883408536901613,
1517
+ "step": 760
1518
+ },
1519
+ {
1520
+ "loss": 0.4471421718597412,
1521
+ "grad_norm": 0.014410309493541718,
1522
+ "learning_rate": 2.0310880829015544e-06,
1523
+ "entropy": 1.6857702764961868,
1524
+ "num_tokens": 12185744.0,
1525
+ "logits/chosen": 0.14331582088471329,
1526
+ "logits/rejected": 0.2682991323037694,
1527
+ "mean_token_accuracy": 0.6441437931358814,
1528
+ "rewards/chosen": -0.6643577039731394,
1529
+ "rewards/rejected": -1.8807749817200239,
1530
+ "rewards/accuracies": 0.81125,
1531
+ "rewards/margins": 1.216417273581028,
1532
+ "logps/chosen": -67.24417539000511,
1533
+ "logps/rejected": -66.79223707199097,
1534
+ "epoch": 0.7987137596597687,
1535
+ "step": 770
1536
+ },
1537
+ {
1538
+ "loss": 0.4785769939422607,
1539
+ "grad_norm": 0.010570192709565163,
1540
+ "learning_rate": 1.9274611398963734e-06,
1541
+ "entropy": 1.6633455219957978,
1542
+ "num_tokens": 12343401.0,
1543
+ "logits/chosen": 0.07438493724116783,
1544
+ "logits/rejected": 0.23364041511381434,
1545
+ "mean_token_accuracy": 0.639512750543654,
1546
+ "rewards/chosen": -0.6736341681498743,
1547
+ "rewards/rejected": -1.796194753185846,
1548
+ "rewards/accuracies": 0.79,
1549
+ "rewards/margins": 1.1225605825753882,
1550
+ "logps/chosen": -62.37282539129257,
1551
+ "logps/rejected": -63.56037598967552,
1552
+ "epoch": 0.809086665629376,
1553
+ "step": 780
1554
+ },
1555
+ {
1556
+ "loss": 0.45286383628845217,
1557
+ "grad_norm": 0.011962756514549255,
1558
+ "learning_rate": 1.823834196891192e-06,
1559
+ "entropy": 1.6700926853902638,
1560
+ "num_tokens": 12502157.0,
1561
+ "logits/chosen": 0.1286325604504252,
1562
+ "logits/rejected": 0.2370263101476654,
1563
+ "mean_token_accuracy": 0.6403315839730204,
1564
+ "rewards/chosen": -0.6551112483125325,
1565
+ "rewards/rejected": -1.8369905388413463,
1566
+ "rewards/accuracies": 0.81625,
1567
+ "rewards/margins": 1.1818792873900383,
1568
+ "logps/chosen": -63.591456497907636,
1569
+ "logps/rejected": -63.02011847734451,
1570
+ "epoch": 0.8194595715989834,
1571
+ "step": 790
1572
+ },
1573
+ {
1574
+ "loss": 0.4665197849273682,
1575
+ "grad_norm": 0.015845410525798798,
1576
+ "learning_rate": 1.7202072538860104e-06,
1577
+ "entropy": 1.7264064208138734,
1578
+ "num_tokens": 12659952.0,
1579
+ "logits/chosen": 0.12747972368676874,
1580
+ "logits/rejected": 0.2234084493421016,
1581
+ "mean_token_accuracy": 0.6323709175549448,
1582
+ "rewards/chosen": -0.670276442007671,
1583
+ "rewards/rejected": -1.800412250665977,
1584
+ "rewards/accuracies": 0.81375,
1585
+ "rewards/margins": 1.1301358060259372,
1586
+ "logps/chosen": -65.14966633319855,
1587
+ "logps/rejected": -62.890252923965456,
1588
+ "epoch": 0.8298324775685908,
1589
+ "step": 800
1590
+ },
1591
+ {
1592
+ "loss": 0.46672878265380857,
1593
+ "grad_norm": 0.011275322176516056,
1594
+ "learning_rate": 1.6165803108808292e-06,
1595
+ "entropy": 1.688749819751829,
1596
+ "num_tokens": 12818219.0,
1597
+ "logits/chosen": 0.08963352847012644,
1598
+ "logits/rejected": 0.1937745526364166,
1599
+ "mean_token_accuracy": 0.6342837125249207,
1600
+ "rewards/chosen": -0.6473926620587008,
1601
+ "rewards/rejected": -1.7900561995629687,
1602
+ "rewards/accuracies": 0.7925,
1603
+ "rewards/margins": 1.142663535233587,
1604
+ "logps/chosen": -63.99472352027893,
1605
+ "logps/rejected": -63.061451687812806,
1606
+ "epoch": 0.8402053835381982,
1607
+ "step": 810
1608
+ },
1609
+ {
1610
+ "loss": 0.4595985412597656,
1611
+ "grad_norm": 0.009922225028276443,
1612
+ "learning_rate": 1.5129533678756477e-06,
1613
+ "entropy": 1.6839555408246816,
1614
+ "num_tokens": 12975834.0,
1615
+ "logits/chosen": 0.14187639603561716,
1616
+ "logits/rejected": 0.2228106795045077,
1617
+ "mean_token_accuracy": 0.6386101646535098,
1618
+ "rewards/chosen": -0.6652093456028524,
1619
+ "rewards/rejected": -1.8065621317276963,
1620
+ "rewards/accuracies": 0.8,
1621
+ "rewards/margins": 1.1413527865428477,
1622
+ "logps/chosen": -65.14974474191666,
1623
+ "logps/rejected": -61.74604295730591,
1624
+ "epoch": 0.8505782895078056,
1625
+ "step": 820
1626
+ },
1627
+ {
1628
+ "loss": 0.4635880470275879,
1629
+ "grad_norm": 0.015552631579339504,
1630
+ "learning_rate": 1.4093264248704663e-06,
1631
+ "entropy": 1.684992496855557,
1632
+ "num_tokens": 13133432.0,
1633
+ "logits/chosen": 0.09258615948240319,
1634
+ "logits/rejected": 0.23631826346334864,
1635
+ "mean_token_accuracy": 0.6466719186119735,
1636
+ "rewards/chosen": -0.6487690168057452,
1637
+ "rewards/rejected": -1.7847515585264773,
1638
+ "rewards/accuracies": 0.81125,
1639
+ "rewards/margins": 1.1359825418051333,
1640
+ "logps/chosen": -61.15254833102226,
1641
+ "logps/rejected": -62.26296893358231,
1642
+ "epoch": 0.860951195477413,
1643
+ "step": 830
1644
+ },
1645
+ {
1646
+ "loss": 0.44598889350891113,
1647
+ "grad_norm": 0.015216046944260597,
1648
+ "learning_rate": 1.3056994818652852e-06,
1649
+ "entropy": 1.709428556431085,
1650
+ "num_tokens": 13291850.0,
1651
+ "logits/chosen": 0.15097671106129862,
1652
+ "logits/rejected": 0.25655990051725586,
1653
+ "mean_token_accuracy": 0.6395855396427215,
1654
+ "rewards/chosen": -0.5992260871930921,
1655
+ "rewards/rejected": -1.8031220447564555,
1656
+ "rewards/accuracies": 0.81125,
1657
+ "rewards/margins": 1.2038959555141628,
1658
+ "logps/chosen": -65.10634205937386,
1659
+ "logps/rejected": -63.04532386302948,
1660
+ "epoch": 0.8713241014470204,
1661
+ "step": 840
1662
+ },
1663
+ {
1664
+ "loss": 0.46810121536254884,
1665
+ "grad_norm": 0.009856506250798702,
1666
+ "learning_rate": 1.2020725388601037e-06,
1667
+ "entropy": 1.70108500065282,
1668
+ "num_tokens": 13450070.0,
1669
+ "logits/chosen": 0.15703350726422605,
1670
+ "logits/rejected": 0.2533505205489093,
1671
+ "mean_token_accuracy": 0.643168338034302,
1672
+ "rewards/chosen": -0.62836980179698,
1673
+ "rewards/rejected": -1.7627987958928224,
1674
+ "rewards/accuracies": 0.80125,
1675
+ "rewards/margins": 1.1344289934798144,
1676
+ "logps/chosen": -64.12525810718536,
1677
+ "logps/rejected": -62.792922837734224,
1678
+ "epoch": 0.8816970074166278,
1679
+ "step": 850
1680
+ },
1681
+ {
1682
+ "loss": 0.44599761962890627,
1683
+ "grad_norm": 0.012146789580583572,
1684
+ "learning_rate": 1.0984455958549225e-06,
1685
+ "entropy": 1.70398797435686,
1686
+ "num_tokens": 13610138.0,
1687
+ "logits/chosen": 0.17104202048628422,
1688
+ "logits/rejected": 0.262595645620993,
1689
+ "mean_token_accuracy": 0.642651722766459,
1690
+ "rewards/chosen": -0.6636459323119197,
1691
+ "rewards/rejected": -1.85319078174929,
1692
+ "rewards/accuracies": 0.8125,
1693
+ "rewards/margins": 1.1895448501838837,
1694
+ "logps/chosen": -67.19200572252274,
1695
+ "logps/rejected": -64.02687373161316,
1696
+ "epoch": 0.8920699133862352,
1697
+ "step": 860
1698
+ },
1699
+ {
1700
+ "loss": 0.4463825702667236,
1701
+ "grad_norm": 0.013926991261541843,
1702
+ "learning_rate": 9.94818652849741e-07,
1703
+ "entropy": 1.6875281669571995,
1704
+ "num_tokens": 13769613.0,
1705
+ "logits/chosen": 0.1617350362536588,
1706
+ "logits/rejected": 0.25974264117481755,
1707
+ "mean_token_accuracy": 0.6424587191455067,
1708
+ "rewards/chosen": -0.6411357878561103,
1709
+ "rewards/rejected": -1.7520794819842558,
1710
+ "rewards/accuracies": 0.8275,
1711
+ "rewards/margins": 1.1109436923218892,
1712
+ "logps/chosen": -66.13908497691155,
1713
+ "logps/rejected": -62.40538552284241,
1714
+ "epoch": 0.9024428193558426,
1715
+ "step": 870
1716
+ },
1717
+ {
1718
+ "eval_loss": 0.5264487266540527,
1719
+ "eval_runtime": 346.8502,
1720
+ "eval_samples_per_second": 2.883,
1721
+ "eval_steps_per_second": 2.883,
1722
+ "eval_entropy": 1.0440044164210558,
1723
+ "eval_num_tokens": 13848578.0,
1724
+ "eval_logits/chosen": -0.18929922542314412,
1725
+ "eval_logits/rejected": -0.05010199907599402,
1726
+ "eval_mean_token_accuracy": 0.6949034848362208,
1727
+ "eval_rewards/chosen": -0.7382756498559029,
1728
+ "eval_rewards/rejected": -1.426999929712445,
1729
+ "eval_rewards/accuracies": 0.743,
1730
+ "eval_rewards/margins": 0.6887242792025209,
1731
+ "eval_logps/chosen": -57.555743215560916,
1732
+ "eval_logps/rejected": -66.9098708076477,
1733
+ "epoch": 0.9076292723406463,
1734
+ "step": 875
1735
+ },
1736
+ {
1737
+ "loss": 0.43689889907836915,
1738
+ "grad_norm": 0.010173802264034748,
1739
+ "learning_rate": 8.911917098445596e-07,
1740
+ "entropy": 1.6774525323137641,
1741
+ "num_tokens": 13928284.0,
1742
+ "logits/chosen": 0.15889503262817226,
1743
+ "logits/rejected": 0.27439704581314006,
1744
+ "mean_token_accuracy": 0.6466628183331341,
1745
+ "rewards/chosen": -0.6104124534751736,
1746
+ "rewards/rejected": -1.7897700341788003,
1747
+ "rewards/accuracies": 0.81625,
1748
+ "rewards/margins": 1.1793575775902718,
1749
+ "logps/chosen": -62.02614854454994,
1750
+ "logps/rejected": -64.84975938558578,
1751
+ "epoch": 0.91281572532545,
1752
+ "step": 880
1753
+ },
1754
+ {
1755
+ "loss": 0.48273696899414065,
1756
+ "grad_norm": 0.017326118424534798,
1757
+ "learning_rate": 7.875647668393784e-07,
1758
+ "entropy": 1.6614145183190703,
1759
+ "num_tokens": 14086112.0,
1760
+ "logits/chosen": 0.07985394351840137,
1761
+ "logits/rejected": 0.20892557638470582,
1762
+ "mean_token_accuracy": 0.6420493371598422,
1763
+ "rewards/chosen": -0.7163908848223582,
1764
+ "rewards/rejected": -1.8062069240648997,
1765
+ "rewards/accuracies": 0.79875,
1766
+ "rewards/margins": 1.0898160382080824,
1767
+ "logps/chosen": -63.230327110290524,
1768
+ "logps/rejected": -64.38345015048981,
1769
+ "epoch": 0.9231886312950573,
1770
+ "step": 890
1771
+ },
1772
+ {
1773
+ "loss": 0.43041396141052246,
1774
+ "grad_norm": 0.017108725383877754,
1775
+ "learning_rate": 6.839378238341969e-07,
1776
+ "entropy": 1.6680658238008619,
1777
+ "num_tokens": 14245558.0,
1778
+ "logits/chosen": 0.14648505909070886,
1779
+ "logits/rejected": 0.26673792896430265,
1780
+ "mean_token_accuracy": 0.6451807205565274,
1781
+ "rewards/chosen": -0.6325454073216497,
1782
+ "rewards/rejected": -1.9007032794272527,
1783
+ "rewards/accuracies": 0.82125,
1784
+ "rewards/margins": 1.2681578750582412,
1785
+ "logps/chosen": -62.82921484231949,
1786
+ "logps/rejected": -66.73553317070008,
1787
+ "epoch": 0.9335615372646647,
1788
+ "step": 900
1789
+ },
1790
+ {
1791
+ "loss": 0.4457756519317627,
1792
+ "grad_norm": 0.010929541662335396,
1793
+ "learning_rate": 5.803108808290156e-07,
1794
+ "entropy": 1.7130034917313606,
1795
+ "num_tokens": 14404540.0,
1796
+ "logits/chosen": 0.12710906584716752,
1797
+ "logits/rejected": 0.2675685432938819,
1798
+ "mean_token_accuracy": 0.6400158200226724,
1799
+ "rewards/chosen": -0.6709339278266998,
1800
+ "rewards/rejected": -1.8822100719693118,
1801
+ "rewards/accuracies": 0.825,
1802
+ "rewards/margins": 1.2112761446926743,
1803
+ "logps/chosen": -64.97942503213882,
1804
+ "logps/rejected": -64.39793292522431,
1805
+ "epoch": 0.9439344432342721,
1806
+ "step": 910
1807
+ },
1808
+ {
1809
+ "loss": 0.45868711471557616,
1810
+ "grad_norm": 0.012205246835947037,
1811
+ "learning_rate": 4.7668393782383424e-07,
1812
+ "entropy": 1.6709410886280238,
1813
+ "num_tokens": 14560645.0,
1814
+ "logits/chosen": 0.10928400241500846,
1815
+ "logits/rejected": 0.2426133711223395,
1816
+ "mean_token_accuracy": 0.6370881532691419,
1817
+ "rewards/chosen": -0.6589926348004519,
1818
+ "rewards/rejected": -1.8069635758572258,
1819
+ "rewards/accuracies": 0.81375,
1820
+ "rewards/margins": 1.14797093979083,
1821
+ "logps/chosen": -61.491244453191754,
1822
+ "logps/rejected": -61.11656880378723,
1823
+ "epoch": 0.9543073492038795,
1824
+ "step": 920
1825
+ },
1826
+ {
1827
+ "loss": 0.4510962963104248,
1828
+ "grad_norm": 0.016680743545293808,
1829
+ "learning_rate": 3.730569948186528e-07,
1830
+ "entropy": 1.7099607919715345,
1831
+ "num_tokens": 14720454.0,
1832
+ "logits/chosen": 0.11883571728281689,
1833
+ "logits/rejected": 0.20641075253811259,
1834
+ "mean_token_accuracy": 0.6349475438706577,
1835
+ "rewards/chosen": -0.6969622136335238,
1836
+ "rewards/rejected": -1.859341476371046,
1837
+ "rewards/accuracies": 0.81,
1838
+ "rewards/margins": 1.162379261488095,
1839
+ "logps/chosen": -65.8184747338295,
1840
+ "logps/rejected": -65.03840645551682,
1841
+ "epoch": 0.9646802551734869,
1842
+ "step": 930
1843
+ },
1844
+ {
1845
+ "loss": 0.44940953254699706,
1846
+ "grad_norm": 0.013420112431049347,
1847
+ "learning_rate": 2.694300518134715e-07,
1848
+ "entropy": 1.6909510315582157,
1849
+ "num_tokens": 14879971.0,
1850
+ "logits/chosen": 0.18477739616368072,
1851
+ "logits/rejected": 0.2645026210979778,
1852
+ "mean_token_accuracy": 0.6382351936399937,
1853
+ "rewards/chosen": -0.6513557667902206,
1854
+ "rewards/rejected": -1.7696480820770375,
1855
+ "rewards/accuracies": 0.815,
1856
+ "rewards/margins": 1.1182923125289381,
1857
+ "logps/chosen": -65.54289688110352,
1858
+ "logps/rejected": -62.99382516860962,
1859
+ "epoch": 0.9750531611430943,
1860
+ "step": 940
1861
+ },
1862
+ {
1863
+ "loss": 0.47352304458618166,
1864
+ "grad_norm": 0.013681693933904171,
1865
+ "learning_rate": 1.6580310880829015e-07,
1866
+ "entropy": 1.661503377771005,
1867
+ "num_tokens": 15038091.0,
1868
+ "logits/chosen": 0.11480745743066594,
1869
+ "logits/rejected": 0.22102661224680678,
1870
+ "mean_token_accuracy": 0.6446126988902688,
1871
+ "rewards/chosen": -0.7158770331276173,
1872
+ "rewards/rejected": -1.8211175910846213,
1873
+ "rewards/accuracies": 0.78875,
1874
+ "rewards/margins": 1.1052405576594173,
1875
+ "logps/chosen": -63.61789976716042,
1876
+ "logps/rejected": -62.64833914756775,
1877
+ "epoch": 0.9854260671127016,
1878
+ "step": 950
1879
+ },
1880
+ {
1881
+ "loss": 0.46666803359985354,
1882
+ "grad_norm": 0.014694225043058395,
1883
+ "learning_rate": 6.217616580310881e-08,
1884
+ "entropy": 1.6944513383321465,
1885
+ "num_tokens": 15198513.0,
1886
+ "logits/chosen": 0.1733613867125754,
1887
+ "logits/rejected": 0.27222349129564544,
1888
+ "mean_token_accuracy": 0.6361824345402419,
1889
+ "rewards/chosen": -0.7022936144633786,
1890
+ "rewards/rejected": -1.8512264592042629,
1891
+ "rewards/accuracies": 0.7925,
1892
+ "rewards/margins": 1.148932844074443,
1893
+ "logps/chosen": -66.14034503817558,
1894
+ "logps/rejected": -63.98270012617111,
1895
+ "epoch": 0.995798973082309,
1896
+ "step": 960
1897
+ },
1898
+ {
1899
+ "train_runtime": 22398.3946,
1900
+ "train_samples_per_second": 3.443,
1901
+ "train_steps_per_second": 0.043,
1902
+ "total_flos": 1.3308435135621734e+17,
1903
+ "train_loss": 0.48160764293967134,
1904
+ "entropy": 1.7446463192686623,
1905
+ "num_tokens": 15263900.0,
1906
+ "logits/chosen": 0.2563561171205477,
1907
+ "logits/rejected": 0.3359260186024246,
1908
+ "mean_token_accuracy": 0.6413786758059337,
1909
+ "rewards/chosen": -0.7268365635874359,
1910
+ "rewards/rejected": -1.856159317700974,
1911
+ "rewards/accuracies": 0.8209876543209876,
1912
+ "rewards/margins": 1.1293227543801436,
1913
+ "logps/chosen": -67.83627563052707,
1914
+ "logps/rejected": -68.1628461767126,
1915
+ "epoch": 1.0,
1916
+ "step": 965
1917
+ }
1918
+ ],
1919
+ "validation_monitor_size": 1000,
1920
+ "validation_monitor_selection": "fixed_seed_random_without_replacement",
1921
+ "validation_monitor_seed": 22,
1922
+ "validation_monitor_indices": [
1923
+ 2,
1924
+ 10,
1925
+ 14,
1926
+ 21,
1927
+ 55,
1928
+ 63,
1929
+ 66,
1930
+ 69,
1931
+ 107,
1932
+ 110,
1933
+ 142,
1934
+ 144,
1935
+ 149,
1936
+ 150,
1937
+ 151,
1938
+ 152,
1939
+ 160,
1940
+ 163,
1941
+ 166,
1942
+ 167,
1943
+ 176,
1944
+ 181,
1945
+ 206,
1946
+ 207,
1947
+ 259,
1948
+ 267,
1949
+ 281,
1950
+ 295,
1951
+ 298,
1952
+ 306,
1953
+ 307,
1954
+ 317,
1955
+ 321,
1956
+ 331,
1957
+ 336,
1958
+ 341,
1959
+ 346,
1960
+ 349,
1961
+ 351,
1962
+ 352,
1963
+ 357,
1964
+ 358,
1965
+ 369,
1966
+ 370,
1967
+ 382,
1968
+ 386,
1969
+ 391,
1970
+ 401,
1971
+ 411,
1972
+ 412,
1973
+ 432,
1974
+ 437,
1975
+ 452,
1976
+ 462,
1977
+ 465,
1978
+ 488,
1979
+ 490,
1980
+ 491,
1981
+ 492,
1982
+ 494,
1983
+ 503,
1984
+ 504,
1985
+ 508,
1986
+ 528,
1987
+ 538,
1988
+ 540,
1989
+ 551,
1990
+ 553,
1991
+ 567,
1992
+ 586,
1993
+ 605,
1994
+ 606,
1995
+ 625,
1996
+ 627,
1997
+ 661,
1998
+ 663,
1999
+ 666,
2000
+ 677,
2001
+ 685,
2002
+ 690,
2003
+ 692,
2004
+ 704,
2005
+ 708,
2006
+ 714,
2007
+ 715,
2008
+ 727,
2009
+ 728,
2010
+ 733,
2011
+ 745,
2012
+ 752,
2013
+ 753,
2014
+ 755,
2015
+ 764,
2016
+ 773,
2017
+ 779,
2018
+ 783,
2019
+ 793,
2020
+ 796,
2021
+ 799,
2022
+ 803,
2023
+ 804,
2024
+ 805,
2025
+ 813,
2026
+ 816,
2027
+ 818,
2028
+ 823,
2029
+ 827,
2030
+ 829,
2031
+ 830,
2032
+ 837,
2033
+ 842,
2034
+ 845,
2035
+ 850,
2036
+ 853,
2037
+ 856,
2038
+ 889,
2039
+ 890,
2040
+ 905,
2041
+ 915,
2042
+ 924,
2043
+ 930,
2044
+ 939,
2045
+ 951,
2046
+ 988,
2047
+ 1002,
2048
+ 1005,
2049
+ 1023,
2050
+ 1029,
2051
+ 1038,
2052
+ 1049,
2053
+ 1050,
2054
+ 1054,
2055
+ 1056,
2056
+ 1067,
2057
+ 1068,
2058
+ 1079,
2059
+ 1088,
2060
+ 1091,
2061
+ 1103,
2062
+ 1114,
2063
+ 1118,
2064
+ 1133,
2065
+ 1140,
2066
+ 1144,
2067
+ 1145,
2068
+ 1155,
2069
+ 1186,
2070
+ 1195,
2071
+ 1206,
2072
+ 1223,
2073
+ 1251,
2074
+ 1252,
2075
+ 1257,
2076
+ 1259,
2077
+ 1270,
2078
+ 1271,
2079
+ 1295,
2080
+ 1303,
2081
+ 1304,
2082
+ 1305,
2083
+ 1329,
2084
+ 1335,
2085
+ 1336,
2086
+ 1343,
2087
+ 1367,
2088
+ 1373,
2089
+ 1377,
2090
+ 1403,
2091
+ 1412,
2092
+ 1429,
2093
+ 1443,
2094
+ 1457,
2095
+ 1459,
2096
+ 1460,
2097
+ 1476,
2098
+ 1483,
2099
+ 1486,
2100
+ 1494,
2101
+ 1507,
2102
+ 1510,
2103
+ 1519,
2104
+ 1521,
2105
+ 1522,
2106
+ 1545,
2107
+ 1551,
2108
+ 1570,
2109
+ 1582,
2110
+ 1593,
2111
+ 1595,
2112
+ 1603,
2113
+ 1607,
2114
+ 1614,
2115
+ 1615,
2116
+ 1625,
2117
+ 1634,
2118
+ 1639,
2119
+ 1648,
2120
+ 1654,
2121
+ 1657,
2122
+ 1662,
2123
+ 1667,
2124
+ 1673,
2125
+ 1690,
2126
+ 1704,
2127
+ 1746,
2128
+ 1756,
2129
+ 1781,
2130
+ 1783,
2131
+ 1796,
2132
+ 1799,
2133
+ 1809,
2134
+ 1814,
2135
+ 1827,
2136
+ 1829,
2137
+ 1832,
2138
+ 1844,
2139
+ 1847,
2140
+ 1854,
2141
+ 1856,
2142
+ 1857,
2143
+ 1858,
2144
+ 1874,
2145
+ 1883,
2146
+ 1889,
2147
+ 1924,
2148
+ 1925,
2149
+ 1931,
2150
+ 1932,
2151
+ 1934,
2152
+ 1935,
2153
+ 1938,
2154
+ 1950,
2155
+ 1957,
2156
+ 1962,
2157
+ 1967,
2158
+ 1975,
2159
+ 1982,
2160
+ 1983,
2161
+ 1991,
2162
+ 1998,
2163
+ 2003,
2164
+ 2008,
2165
+ 2017,
2166
+ 2021,
2167
+ 2026,
2168
+ 2035,
2169
+ 2040,
2170
+ 2050,
2171
+ 2056,
2172
+ 2077,
2173
+ 2079,
2174
+ 2082,
2175
+ 2098,
2176
+ 2100,
2177
+ 2108,
2178
+ 2121,
2179
+ 2130,
2180
+ 2133,
2181
+ 2134,
2182
+ 2138,
2183
+ 2143,
2184
+ 2166,
2185
+ 2167,
2186
+ 2180,
2187
+ 2181,
2188
+ 2185,
2189
+ 2204,
2190
+ 2205,
2191
+ 2212,
2192
+ 2221,
2193
+ 2224,
2194
+ 2226,
2195
+ 2230,
2196
+ 2233,
2197
+ 2256,
2198
+ 2261,
2199
+ 2263,
2200
+ 2269,
2201
+ 2273,
2202
+ 2290,
2203
+ 2291,
2204
+ 2299,
2205
+ 2301,
2206
+ 2321,
2207
+ 2323,
2208
+ 2330,
2209
+ 2384,
2210
+ 2401,
2211
+ 2417,
2212
+ 2420,
2213
+ 2421,
2214
+ 2424,
2215
+ 2430,
2216
+ 2435,
2217
+ 2456,
2218
+ 2488,
2219
+ 2502,
2220
+ 2504,
2221
+ 2519,
2222
+ 2527,
2223
+ 2532,
2224
+ 2538,
2225
+ 2542,
2226
+ 2553,
2227
+ 2555,
2228
+ 2558,
2229
+ 2559,
2230
+ 2562,
2231
+ 2578,
2232
+ 2583,
2233
+ 2585,
2234
+ 2590,
2235
+ 2592,
2236
+ 2594,
2237
+ 2596,
2238
+ 2600,
2239
+ 2606,
2240
+ 2607,
2241
+ 2618,
2242
+ 2630,
2243
+ 2637,
2244
+ 2647,
2245
+ 2650,
2246
+ 2657,
2247
+ 2679,
2248
+ 2685,
2249
+ 2705,
2250
+ 2706,
2251
+ 2712,
2252
+ 2713,
2253
+ 2714,
2254
+ 2727,
2255
+ 2740,
2256
+ 2742,
2257
+ 2755,
2258
+ 2780,
2259
+ 2784,
2260
+ 2792,
2261
+ 2807,
2262
+ 2808,
2263
+ 2810,
2264
+ 2820,
2265
+ 2831,
2266
+ 2839,
2267
+ 2860,
2268
+ 2862,
2269
+ 2863,
2270
+ 2866,
2271
+ 2875,
2272
+ 2878,
2273
+ 2898,
2274
+ 2905,
2275
+ 2921,
2276
+ 2922,
2277
+ 2926,
2278
+ 2930,
2279
+ 2934,
2280
+ 2944,
2281
+ 2955,
2282
+ 2957,
2283
+ 2959,
2284
+ 2973,
2285
+ 2978,
2286
+ 2998,
2287
+ 3018,
2288
+ 3022,
2289
+ 3028,
2290
+ 3031,
2291
+ 3061,
2292
+ 3085,
2293
+ 3090,
2294
+ 3104,
2295
+ 3105,
2296
+ 3111,
2297
+ 3115,
2298
+ 3121,
2299
+ 3122,
2300
+ 3129,
2301
+ 3133,
2302
+ 3135,
2303
+ 3161,
2304
+ 3162,
2305
+ 3169,
2306
+ 3173,
2307
+ 3194,
2308
+ 3195,
2309
+ 3215,
2310
+ 3225,
2311
+ 3226,
2312
+ 3241,
2313
+ 3247,
2314
+ 3250,
2315
+ 3253,
2316
+ 3265,
2317
+ 3268,
2318
+ 3293,
2319
+ 3301,
2320
+ 3312,
2321
+ 3329,
2322
+ 3352,
2323
+ 3361,
2324
+ 3362,
2325
+ 3376,
2326
+ 3396,
2327
+ 3401,
2328
+ 3403,
2329
+ 3410,
2330
+ 3419,
2331
+ 3432,
2332
+ 3443,
2333
+ 3452,
2334
+ 3467,
2335
+ 3469,
2336
+ 3475,
2337
+ 3485,
2338
+ 3503,
2339
+ 3514,
2340
+ 3515,
2341
+ 3524,
2342
+ 3528,
2343
+ 3538,
2344
+ 3544,
2345
+ 3557,
2346
+ 3560,
2347
+ 3565,
2348
+ 3600,
2349
+ 3637,
2350
+ 3642,
2351
+ 3658,
2352
+ 3659,
2353
+ 3692,
2354
+ 3693,
2355
+ 3699,
2356
+ 3722,
2357
+ 3725,
2358
+ 3728,
2359
+ 3731,
2360
+ 3740,
2361
+ 3742,
2362
+ 3762,
2363
+ 3766,
2364
+ 3780,
2365
+ 3788,
2366
+ 3794,
2367
+ 3796,
2368
+ 3798,
2369
+ 3805,
2370
+ 3817,
2371
+ 3819,
2372
+ 3822,
2373
+ 3837,
2374
+ 3839,
2375
+ 3843,
2376
+ 3846,
2377
+ 3851,
2378
+ 3854,
2379
+ 3865,
2380
+ 3870,
2381
+ 3871,
2382
+ 3884,
2383
+ 3894,
2384
+ 3895,
2385
+ 3896,
2386
+ 3907,
2387
+ 3911,
2388
+ 3915,
2389
+ 3919,
2390
+ 3920,
2391
+ 3923,
2392
+ 3933,
2393
+ 3955,
2394
+ 3967,
2395
+ 3972,
2396
+ 3974,
2397
+ 3975,
2398
+ 3984,
2399
+ 3985,
2400
+ 3997,
2401
+ 4002,
2402
+ 4010,
2403
+ 4034,
2404
+ 4044,
2405
+ 4063,
2406
+ 4073,
2407
+ 4079,
2408
+ 4082,
2409
+ 4088,
2410
+ 4121,
2411
+ 4145,
2412
+ 4148,
2413
+ 4159,
2414
+ 4161,
2415
+ 4164,
2416
+ 4177,
2417
+ 4188,
2418
+ 4199,
2419
+ 4203,
2420
+ 4207,
2421
+ 4208,
2422
+ 4213,
2423
+ 4221,
2424
+ 4225,
2425
+ 4233,
2426
+ 4241,
2427
+ 4243,
2428
+ 4247,
2429
+ 4264,
2430
+ 4274,
2431
+ 4282,
2432
+ 4286,
2433
+ 4290,
2434
+ 4308,
2435
+ 4310,
2436
+ 4313,
2437
+ 4321,
2438
+ 4324,
2439
+ 4327,
2440
+ 4349,
2441
+ 4362,
2442
+ 4370,
2443
+ 4374,
2444
+ 4380,
2445
+ 4407,
2446
+ 4409,
2447
+ 4411,
2448
+ 4415,
2449
+ 4417,
2450
+ 4418,
2451
+ 4427,
2452
+ 4431,
2453
+ 4433,
2454
+ 4451,
2455
+ 4466,
2456
+ 4477,
2457
+ 4478,
2458
+ 4479,
2459
+ 4493,
2460
+ 4494,
2461
+ 4514,
2462
+ 4527,
2463
+ 4539,
2464
+ 4550,
2465
+ 4558,
2466
+ 4568,
2467
+ 4579,
2468
+ 4583,
2469
+ 4584,
2470
+ 4586,
2471
+ 4587,
2472
+ 4590,
2473
+ 4599,
2474
+ 4602,
2475
+ 4610,
2476
+ 4626,
2477
+ 4627,
2478
+ 4630,
2479
+ 4641,
2480
+ 4647,
2481
+ 4655,
2482
+ 4656,
2483
+ 4657,
2484
+ 4661,
2485
+ 4685,
2486
+ 4714,
2487
+ 4715,
2488
+ 4731,
2489
+ 4749,
2490
+ 4752,
2491
+ 4769,
2492
+ 4777,
2493
+ 4782,
2494
+ 4791,
2495
+ 4805,
2496
+ 4818,
2497
+ 4829,
2498
+ 4833,
2499
+ 4837,
2500
+ 4839,
2501
+ 4843,
2502
+ 4871,
2503
+ 4875,
2504
+ 4879,
2505
+ 4880,
2506
+ 4885,
2507
+ 4888,
2508
+ 4895,
2509
+ 4900,
2510
+ 4923,
2511
+ 4966,
2512
+ 4968,
2513
+ 4972,
2514
+ 4989,
2515
+ 4994,
2516
+ 4998,
2517
+ 5001,
2518
+ 5013,
2519
+ 5019,
2520
+ 5026,
2521
+ 5032,
2522
+ 5034,
2523
+ 5046,
2524
+ 5055,
2525
+ 5085,
2526
+ 5086,
2527
+ 5088,
2528
+ 5089,
2529
+ 5090,
2530
+ 5095,
2531
+ 5108,
2532
+ 5110,
2533
+ 5119,
2534
+ 5120,
2535
+ 5121,
2536
+ 5133,
2537
+ 5148,
2538
+ 5154,
2539
+ 5160,
2540
+ 5169,
2541
+ 5178,
2542
+ 5222,
2543
+ 5223,
2544
+ 5232,
2545
+ 5233,
2546
+ 5240,
2547
+ 5256,
2548
+ 5259,
2549
+ 5264,
2550
+ 5271,
2551
+ 5276,
2552
+ 5279,
2553
+ 5294,
2554
+ 5300,
2555
+ 5303,
2556
+ 5321,
2557
+ 5335,
2558
+ 5337,
2559
+ 5345,
2560
+ 5348,
2561
+ 5365,
2562
+ 5373,
2563
+ 5378,
2564
+ 5384,
2565
+ 5422,
2566
+ 5442,
2567
+ 5443,
2568
+ 5445,
2569
+ 5477,
2570
+ 5485,
2571
+ 5495,
2572
+ 5497,
2573
+ 5504,
2574
+ 5526,
2575
+ 5533,
2576
+ 5542,
2577
+ 5564,
2578
+ 5570,
2579
+ 5579,
2580
+ 5587,
2581
+ 5592,
2582
+ 5608,
2583
+ 5610,
2584
+ 5624,
2585
+ 5630,
2586
+ 5638,
2587
+ 5651,
2588
+ 5663,
2589
+ 5670,
2590
+ 5675,
2591
+ 5691,
2592
+ 5700,
2593
+ 5706,
2594
+ 5707,
2595
+ 5715,
2596
+ 5720,
2597
+ 5721,
2598
+ 5722,
2599
+ 5732,
2600
+ 5738,
2601
+ 5741,
2602
+ 5769,
2603
+ 5771,
2604
+ 5775,
2605
+ 5795,
2606
+ 5796,
2607
+ 5800,
2608
+ 5809,
2609
+ 5810,
2610
+ 5815,
2611
+ 5819,
2612
+ 5827,
2613
+ 5848,
2614
+ 5849,
2615
+ 5852,
2616
+ 5859,
2617
+ 5880,
2618
+ 5884,
2619
+ 5907,
2620
+ 5909,
2621
+ 5912,
2622
+ 5919,
2623
+ 5931,
2624
+ 5932,
2625
+ 5934,
2626
+ 5941,
2627
+ 5948,
2628
+ 5950,
2629
+ 5952,
2630
+ 5953,
2631
+ 5969,
2632
+ 5981,
2633
+ 6000,
2634
+ 6003,
2635
+ 6010,
2636
+ 6018,
2637
+ 6041,
2638
+ 6065,
2639
+ 6075,
2640
+ 6090,
2641
+ 6103,
2642
+ 6106,
2643
+ 6109,
2644
+ 6114,
2645
+ 6123,
2646
+ 6131,
2647
+ 6136,
2648
+ 6138,
2649
+ 6139,
2650
+ 6164,
2651
+ 6165,
2652
+ 6171,
2653
+ 6173,
2654
+ 6180,
2655
+ 6185,
2656
+ 6189,
2657
+ 6190,
2658
+ 6221,
2659
+ 6223,
2660
+ 6237,
2661
+ 6255,
2662
+ 6262,
2663
+ 6265,
2664
+ 6293,
2665
+ 6296,
2666
+ 6305,
2667
+ 6318,
2668
+ 6331,
2669
+ 6336,
2670
+ 6340,
2671
+ 6355,
2672
+ 6366,
2673
+ 6371,
2674
+ 6396,
2675
+ 6399,
2676
+ 6402,
2677
+ 6408,
2678
+ 6432,
2679
+ 6433,
2680
+ 6441,
2681
+ 6456,
2682
+ 6465,
2683
+ 6478,
2684
+ 6486,
2685
+ 6489,
2686
+ 6507,
2687
+ 6508,
2688
+ 6520,
2689
+ 6522,
2690
+ 6528,
2691
+ 6537,
2692
+ 6551,
2693
+ 6564,
2694
+ 6589,
2695
+ 6590,
2696
+ 6598,
2697
+ 6599,
2698
+ 6611,
2699
+ 6613,
2700
+ 6615,
2701
+ 6621,
2702
+ 6634,
2703
+ 6647,
2704
+ 6649,
2705
+ 6654,
2706
+ 6676,
2707
+ 6680,
2708
+ 6690,
2709
+ 6708,
2710
+ 6729,
2711
+ 6736,
2712
+ 6744,
2713
+ 6749,
2714
+ 6756,
2715
+ 6761,
2716
+ 6763,
2717
+ 6773,
2718
+ 6788,
2719
+ 6790,
2720
+ 6796,
2721
+ 6797,
2722
+ 6811,
2723
+ 6824,
2724
+ 6850,
2725
+ 6869,
2726
+ 6871,
2727
+ 6882,
2728
+ 6892,
2729
+ 6895,
2730
+ 6906,
2731
+ 6911,
2732
+ 6912,
2733
+ 6914,
2734
+ 6927,
2735
+ 6952,
2736
+ 6966,
2737
+ 6985,
2738
+ 7001,
2739
+ 7021,
2740
+ 7031,
2741
+ 7035,
2742
+ 7038,
2743
+ 7041,
2744
+ 7045,
2745
+ 7052,
2746
+ 7057,
2747
+ 7058,
2748
+ 7072,
2749
+ 7073,
2750
+ 7076,
2751
+ 7086,
2752
+ 7102,
2753
+ 7107,
2754
+ 7109,
2755
+ 7117,
2756
+ 7122,
2757
+ 7125,
2758
+ 7166,
2759
+ 7182,
2760
+ 7199,
2761
+ 7207,
2762
+ 7212,
2763
+ 7215,
2764
+ 7232,
2765
+ 7243,
2766
+ 7246,
2767
+ 7250,
2768
+ 7253,
2769
+ 7258,
2770
+ 7263,
2771
+ 7267,
2772
+ 7270,
2773
+ 7274,
2774
+ 7280,
2775
+ 7286,
2776
+ 7293,
2777
+ 7298,
2778
+ 7302,
2779
+ 7306,
2780
+ 7316,
2781
+ 7325,
2782
+ 7326,
2783
+ 7334,
2784
+ 7356,
2785
+ 7357,
2786
+ 7363,
2787
+ 7364,
2788
+ 7367,
2789
+ 7385,
2790
+ 7392,
2791
+ 7399,
2792
+ 7405,
2793
+ 7416,
2794
+ 7420,
2795
+ 7421,
2796
+ 7426,
2797
+ 7452,
2798
+ 7476,
2799
+ 7481,
2800
+ 7519,
2801
+ 7534,
2802
+ 7542,
2803
+ 7546,
2804
+ 7573,
2805
+ 7585,
2806
+ 7601,
2807
+ 7604,
2808
+ 7606,
2809
+ 7609,
2810
+ 7629,
2811
+ 7649,
2812
+ 7653,
2813
+ 7667,
2814
+ 7682,
2815
+ 7699,
2816
+ 7738,
2817
+ 7750,
2818
+ 7786,
2819
+ 7798,
2820
+ 7800,
2821
+ 7801,
2822
+ 7805,
2823
+ 7806,
2824
+ 7811,
2825
+ 7813,
2826
+ 7832,
2827
+ 7837,
2828
+ 7849,
2829
+ 7856,
2830
+ 7876,
2831
+ 7877,
2832
+ 7887,
2833
+ 7905,
2834
+ 7916,
2835
+ 7919,
2836
+ 7920,
2837
+ 7922,
2838
+ 7923,
2839
+ 7926,
2840
+ 7944,
2841
+ 7961,
2842
+ 7966,
2843
+ 7970,
2844
+ 7973,
2845
+ 7974,
2846
+ 7976,
2847
+ 7986,
2848
+ 7999,
2849
+ 8027,
2850
+ 8028,
2851
+ 8034,
2852
+ 8047,
2853
+ 8068,
2854
+ 8074,
2855
+ 8077,
2856
+ 8091,
2857
+ 8120,
2858
+ 8122,
2859
+ 8125,
2860
+ 8152,
2861
+ 8153,
2862
+ 8164,
2863
+ 8167,
2864
+ 8169,
2865
+ 8171,
2866
+ 8177,
2867
+ 8184,
2868
+ 8189,
2869
+ 8192,
2870
+ 8196,
2871
+ 8202,
2872
+ 8212,
2873
+ 8217,
2874
+ 8231,
2875
+ 8242,
2876
+ 8244,
2877
+ 8250,
2878
+ 8256,
2879
+ 8257,
2880
+ 8265,
2881
+ 8270,
2882
+ 8274,
2883
+ 8283,
2884
+ 8290,
2885
+ 8294,
2886
+ 8301,
2887
+ 8302,
2888
+ 8307,
2889
+ 8318,
2890
+ 8326,
2891
+ 8338,
2892
+ 8349,
2893
+ 8350,
2894
+ 8353,
2895
+ 8357,
2896
+ 8371,
2897
+ 8374,
2898
+ 8377,
2899
+ 8380,
2900
+ 8387,
2901
+ 8388,
2902
+ 8396,
2903
+ 8402,
2904
+ 8419,
2905
+ 8423,
2906
+ 8428,
2907
+ 8435,
2908
+ 8439,
2909
+ 8442,
2910
+ 8444,
2911
+ 8453,
2912
+ 8461,
2913
+ 8475,
2914
+ 8481,
2915
+ 8485,
2916
+ 8493,
2917
+ 8495,
2918
+ 8498,
2919
+ 8523,
2920
+ 8530,
2921
+ 8531,
2922
+ 8562
2923
+ ],
2924
+ "early_stopping_patience": 3
2925
+ }
phase1/ablations/helps_only/README.md ADDED
@@ -0,0 +1,80 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: peft
3
+ model_name: phase1-qwen-helps-only-ablation
4
+ tags:
5
+ - base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct
6
+ - dpo
7
+ - lora
8
+ - transformers
9
+ - trl
10
+ license: apache-2.0
11
+ base_model: Qwen/Qwen2.5-1.5B-Instruct
12
+ pipeline_tag: text-generation
13
+ ---
14
+
15
+ # Phase 1 Qwen `helps_only` diagnostic ablation
16
+
17
+ This is the Phase 1 `helps_only` diagnostic LoRA-DPO adapter fine-tuned from
18
+ [Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct).
19
+ The frozen training recipe and membership hashes are included in this directory.
20
+
21
+ ## Quick start
22
+
23
+ ```python
24
+ from peft import PeftModel
25
+ from transformers import AutoModelForCausalLM, AutoTokenizer
26
+
27
+ repo_id = "geyuxu/york-milestone-project-self-traing-loop-model"
28
+ subfolder = "phase1/ablations/helps_only"
29
+ base_id = "Qwen/Qwen2.5-1.5B-Instruct"
30
+
31
+ tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder)
32
+ base_model = AutoModelForCausalLM.from_pretrained(
33
+ base_id, torch_dtype="auto", device_map="auto"
34
+ )
35
+ model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder)
36
+ ```
37
+
38
+ ## Training procedure
39
+
40
+
41
+
42
+
43
+
44
+ This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290).
45
+
46
+ ### Framework versions
47
+
48
+ - PEFT 0.18.1
49
+ - TRL: 0.29.0
50
+ - Transformers: 5.3.0
51
+ - Pytorch: 2.10.0
52
+ - Datasets: 4.6.1
53
+ - Tokenizers: 0.22.2
54
+
55
+ ## Citations
56
+
57
+ Cite DPO as:
58
+
59
+ ```bibtex
60
+ @inproceedings{rafailov2023direct,
61
+ title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}},
62
+ author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn},
63
+ year = 2023,
64
+ booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023},
65
+ url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html},
66
+ editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine},
67
+ }
68
+ ```
69
+
70
+ Cite TRL as:
71
+
72
+ ```bibtex
73
+ @software{vonwerra2020trl,
74
+ title = {{TRL: Transformers Reinforcement Learning}},
75
+ author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin},
76
+ license = {Apache-2.0},
77
+ url = {https://github.com/huggingface/trl},
78
+ year = {2020}
79
+ }
80
+ ```
phase1/ablations/helps_only/adapter_config.json ADDED
@@ -0,0 +1,43 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 32,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "megatron_config": null,
23
+ "megatron_core": "megatron.core",
24
+ "modules_to_save": null,
25
+ "peft_type": "LORA",
26
+ "peft_version": "0.18.1",
27
+ "qalora_group_size": 16,
28
+ "r": 16,
29
+ "rank_pattern": {},
30
+ "revision": null,
31
+ "target_modules": [
32
+ "v_proj",
33
+ "k_proj",
34
+ "o_proj",
35
+ "q_proj"
36
+ ],
37
+ "target_parameters": null,
38
+ "task_type": "CAUSAL_LM",
39
+ "trainable_token_indices": null,
40
+ "use_dora": false,
41
+ "use_qalora": false,
42
+ "use_rslora": false
43
+ }
phase1/ablations/helps_only/adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a143ad6c49a7a1b1d98e81af88412c91b367a394fa48a89517d6057fddf91748
3
+ size 17462432
phase1/ablations/helps_only/chat_template.jinja ADDED
@@ -0,0 +1,54 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0]['role'] == 'system' %}
4
+ {{- messages[0]['content'] }}
5
+ {%- else %}
6
+ {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }}
7
+ {%- endif %}
8
+ {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
9
+ {%- for tool in tools %}
10
+ {{- "\n" }}
11
+ {{- tool | tojson }}
12
+ {%- endfor %}
13
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
14
+ {%- else %}
15
+ {%- if messages[0]['role'] == 'system' %}
16
+ {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }}
17
+ {%- else %}
18
+ {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }}
19
+ {%- endif %}
20
+ {%- endif %}
21
+ {%- for message in messages %}
22
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %}
23
+ {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
24
+ {%- elif message.role == "assistant" %}
25
+ {{- '<|im_start|>' + message.role }}
26
+ {%- if message.content %}
27
+ {{- '\n' + message.content }}
28
+ {%- endif %}
29
+ {%- for tool_call in message.tool_calls %}
30
+ {%- if tool_call.function is defined %}
31
+ {%- set tool_call = tool_call.function %}
32
+ {%- endif %}
33
+ {{- '\n<tool_call>\n{"name": "' }}
34
+ {{- tool_call.name }}
35
+ {{- '", "arguments": ' }}
36
+ {{- tool_call.arguments | tojson }}
37
+ {{- '}\n</tool_call>' }}
38
+ {%- endfor %}
39
+ {{- '<|im_end|>\n' }}
40
+ {%- elif message.role == "tool" %}
41
+ {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %}
42
+ {{- '<|im_start|>user' }}
43
+ {%- endif %}
44
+ {{- '\n<tool_response>\n' }}
45
+ {{- message.content }}
46
+ {{- '\n</tool_response>' }}
47
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
48
+ {{- '<|im_end|>\n' }}
49
+ {%- endif %}
50
+ {%- endif %}
51
+ {%- endfor %}
52
+ {%- if add_generation_prompt %}
53
+ {{- '<|im_start|>assistant\n' }}
54
+ {%- endif %}
phase1/ablations/helps_only/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5
3
+ size 11422166
phase1/ablations/helps_only/tokenizer_config.json ADDED
@@ -0,0 +1,29 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": null,
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|im_start|>",
10
+ "<|im_end|>",
11
+ "<|object_ref_start|>",
12
+ "<|object_ref_end|>",
13
+ "<|box_start|>",
14
+ "<|box_end|>",
15
+ "<|quad_start|>",
16
+ "<|quad_end|>",
17
+ "<|vision_start|>",
18
+ "<|vision_end|>",
19
+ "<|vision_pad|>",
20
+ "<|image_pad|>",
21
+ "<|video_pad|>"
22
+ ],
23
+ "is_local": true,
24
+ "model_max_length": 131072,
25
+ "pad_token": "<|endoftext|>",
26
+ "split_special_tokens": false,
27
+ "tokenizer_class": "Qwen2Tokenizer",
28
+ "unk_token": null
29
+ }
phase1/ablations/helps_only/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:101d92ecb945e3232d561989c7a979ff91d184b4cccbe34a200a56060e3c5ce6
3
+ size 5841
phase1/ablations/helps_only/training_recipe.json ADDED
@@ -0,0 +1,22 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "format_version": 1,
3
+ "experiment": "confusion_ablation",
4
+ "ablation": "helps_only",
5
+ "model_name": "Qwen/Qwen2.5-1.5B-Instruct",
6
+ "train_membership_sha256": "5febb0b71375db4da6a27fdaa6d3226681631022eab8e57a816d93519c4854ab",
7
+ "validation_membership_sha256": "2f609467438cd6a01fd84b9d80c0fcd84c44767e3b2ed98f4f6a83d68a62c181",
8
+ "num_train_pairs": 77124,
9
+ "num_validation_pairs": 8563,
10
+ "transformation_seed": 22,
11
+ "validation_prompt_mode": "clean_rag",
12
+ "learning_rate": 1e-05,
13
+ "beta": 0.1,
14
+ "num_epochs": 1.0,
15
+ "seed": 22,
16
+ "max_length": 512,
17
+ "max_prompt_length": 384,
18
+ "gradient_accumulation_steps": 80,
19
+ "save_steps": 125,
20
+ "save_total_limit": 12,
21
+ "preference_pairs_format_version": 2
22
+ }
phase1/ablations/helps_only/training_summary.json ADDED
@@ -0,0 +1,2029 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_name": "Qwen/Qwen2.5-1.5B-Instruct",
3
+ "resolved_model": "Qwen/Qwen2.5-1.5B-Instruct",
4
+ "num_train_records": 77124,
5
+ "num_validation_records_available": 8563,
6
+ "training_config": {
7
+ "lora_rank": 16,
8
+ "lora_alpha": 32,
9
+ "learning_rate": 1e-05,
10
+ "num_epochs": 1.0,
11
+ "per_device_batch_size": 1,
12
+ "per_device_eval_batch_size": 1,
13
+ "gradient_accumulation_steps": 80,
14
+ "beta": 0.1,
15
+ "max_length": 512,
16
+ "max_prompt_length": 384,
17
+ "seed": 22,
18
+ "save_steps": 125,
19
+ "save_total_limit": 12,
20
+ "resume_from_checkpoint": null,
21
+ "precision_dtype": "torch.bfloat16",
22
+ "bf16": true,
23
+ "fp16": false,
24
+ "tokenizer_add_bos_token": false
25
+ },
26
+ "global_step": 500,
27
+ "best_metric": 0.5006195306777954,
28
+ "best_model_checkpoint": "outputs/confusion_ablation_phase1_repair_v3/helps_only/lora/checkpoint-125",
29
+ "train_metrics": {
30
+ "train_runtime": 16864.5913,
31
+ "train_samples_per_second": 4.573,
32
+ "train_steps_per_second": 0.057,
33
+ "total_flos": 2.7163725934432666e+17,
34
+ "train_loss": 0.23282903826236725
35
+ },
36
+ "log_history": [
37
+ {
38
+ "loss": 0.6858583450317383,
39
+ "grad_norm": 0.016611717641353607,
40
+ "learning_rate": 9.906735751295338e-06,
41
+ "entropy": 0.794021682399325,
42
+ "num_tokens": 670561.0,
43
+ "logits/chosen": -0.9187091639020697,
44
+ "logits/rejected": -0.9434830672895622,
45
+ "mean_token_accuracy": 0.736259245146066,
46
+ "rewards/chosen": 0.0011638513133243578,
47
+ "rewards/rejected": -0.013860612378184669,
48
+ "rewards/accuracies": 0.5925,
49
+ "rewards/margins": 0.015024463631707476,
50
+ "logps/chosen": -54.79746845722198,
51
+ "logps/rejected": -49.96550277948379,
52
+ "epoch": 0.010372905969607386,
53
+ "step": 10
54
+ },
55
+ {
56
+ "loss": 0.6576845169067382,
57
+ "grad_norm": 0.016666823998093605,
58
+ "learning_rate": 9.803108808290156e-06,
59
+ "entropy": 0.7863238480500877,
60
+ "num_tokens": 1340958.0,
61
+ "logits/chosen": -0.9552881883230906,
62
+ "logits/rejected": -0.9189709572546179,
63
+ "mean_token_accuracy": 0.7423679579421878,
64
+ "rewards/chosen": -0.013600413688568552,
65
+ "rewards/rejected": -0.08799497530219376,
66
+ "rewards/accuracies": 0.85875,
67
+ "rewards/margins": 0.07439456147782039,
68
+ "logps/chosen": -55.26659148097038,
69
+ "logps/rejected": -49.557674720287324,
70
+ "epoch": 0.02074581193921477,
71
+ "step": 20
72
+ },
73
+ {
74
+ "loss": 0.6105106353759766,
75
+ "grad_norm": 0.015847327187657356,
76
+ "learning_rate": 9.699481865284975e-06,
77
+ "entropy": 0.846787225897424,
78
+ "num_tokens": 2013796.0,
79
+ "logits/chosen": -0.8573241884593181,
80
+ "logits/rejected": -0.8453699552830984,
81
+ "mean_token_accuracy": 0.727089679390192,
82
+ "rewards/chosen": -0.06516332936625986,
83
+ "rewards/rejected": -0.24710432796498935,
84
+ "rewards/accuracies": 0.8575,
85
+ "rewards/margins": 0.18194099859509152,
86
+ "logps/chosen": -59.86930260896683,
87
+ "logps/rejected": -53.61334676504135,
88
+ "epoch": 0.031118717908822157,
89
+ "step": 30
90
+ },
91
+ {
92
+ "loss": 0.560779619216919,
93
+ "grad_norm": 0.01469502318650484,
94
+ "learning_rate": 9.595854922279793e-06,
95
+ "entropy": 0.7988823162578046,
96
+ "num_tokens": 2684543.0,
97
+ "logits/chosen": -0.9062229187635736,
98
+ "logits/rejected": -0.8287031519573034,
99
+ "mean_token_accuracy": 0.726212237663567,
100
+ "rewards/chosen": -0.15750733469684747,
101
+ "rewards/rejected": -0.47408700099374984,
102
+ "rewards/accuracies": 0.8625,
103
+ "rewards/margins": 0.3165796657791361,
104
+ "logps/chosen": -57.612799718379975,
105
+ "logps/rejected": -53.58559124469757,
106
+ "epoch": 0.04149162387842954,
107
+ "step": 40
108
+ },
109
+ {
110
+ "loss": 0.5105207920074463,
111
+ "grad_norm": 0.014577334746718407,
112
+ "learning_rate": 9.492227979274612e-06,
113
+ "entropy": 0.7784375699353404,
114
+ "num_tokens": 3356031.0,
115
+ "logits/chosen": -0.913959642386141,
116
+ "logits/rejected": -0.8075734227458465,
117
+ "mean_token_accuracy": 0.7303825634159148,
118
+ "rewards/chosen": -0.32432046058405833,
119
+ "rewards/rejected": -0.8036991727564601,
120
+ "rewards/accuracies": 0.8625,
121
+ "rewards/margins": 0.4793787114601582,
122
+ "logps/chosen": -60.06104364156723,
123
+ "logps/rejected": -56.74762117385864,
124
+ "epoch": 0.051864529848036925,
125
+ "step": 50
126
+ },
127
+ {
128
+ "loss": 0.4511364459991455,
129
+ "grad_norm": 0.01305594015866518,
130
+ "learning_rate": 9.388601036269432e-06,
131
+ "entropy": 0.7942980694322614,
132
+ "num_tokens": 4026577.0,
133
+ "logits/chosen": -0.9856768630883611,
134
+ "logits/rejected": -0.8317867858234134,
135
+ "mean_token_accuracy": 0.7197631917707622,
136
+ "rewards/chosen": -0.5297682328737574,
137
+ "rewards/rejected": -1.217431449344149,
138
+ "rewards/accuracies": 0.88625,
139
+ "rewards/margins": 0.6876632150541991,
140
+ "logps/chosen": -60.84162630081177,
141
+ "logps/rejected": -61.641977578401566,
142
+ "epoch": 0.062237435817644314,
143
+ "step": 60
144
+ },
145
+ {
146
+ "loss": 0.422989559173584,
147
+ "grad_norm": 0.01258748210966587,
148
+ "learning_rate": 9.284974093264249e-06,
149
+ "entropy": 0.7553169909078861,
150
+ "num_tokens": 4696820.0,
151
+ "logits/chosen": -1.1534164984013175,
152
+ "logits/rejected": -0.9453616152186384,
153
+ "mean_token_accuracy": 0.7059021528251469,
154
+ "rewards/chosen": -0.8479185369245533,
155
+ "rewards/rejected": -1.733439953867346,
156
+ "rewards/accuracies": 0.85125,
157
+ "rewards/margins": 0.8855214151740074,
158
+ "logps/chosen": -64.60678691148757,
159
+ "logps/rejected": -65.6156524682045,
160
+ "epoch": 0.0726103417872517,
161
+ "step": 70
162
+ },
163
+ {
164
+ "loss": 0.37308950424194337,
165
+ "grad_norm": 0.013154606334865093,
166
+ "learning_rate": 9.181347150259067e-06,
167
+ "entropy": 0.7961554935819004,
168
+ "num_tokens": 5368225.0,
169
+ "logits/chosen": -1.1909632763159101,
170
+ "logits/rejected": -0.9626243884256602,
171
+ "mean_token_accuracy": 0.7057545288372785,
172
+ "rewards/chosen": -1.0665127522181137,
173
+ "rewards/rejected": -2.248069805242121,
174
+ "rewards/accuracies": 0.8875,
175
+ "rewards/margins": 1.1815570489689708,
176
+ "logps/chosen": -68.12463062763214,
177
+ "logps/rejected": -72.84404395580292,
178
+ "epoch": 0.08298324775685909,
179
+ "step": 80
180
+ },
181
+ {
182
+ "loss": 0.36935536861419677,
183
+ "grad_norm": 0.015311975963413715,
184
+ "learning_rate": 9.077720207253888e-06,
185
+ "entropy": 0.7894015382009093,
186
+ "num_tokens": 6040068.0,
187
+ "logits/chosen": -1.3107291135601724,
188
+ "logits/rejected": -1.0484886964785651,
189
+ "mean_token_accuracy": 0.7019536628946662,
190
+ "rewards/chosen": -1.3442938781030533,
191
+ "rewards/rejected": -2.594835725099547,
192
+ "rewards/accuracies": 0.875,
193
+ "rewards/margins": 1.2505418445914984,
194
+ "logps/chosen": -72.38709788918496,
195
+ "logps/rejected": -75.64441309213639,
196
+ "epoch": 0.09335615372646647,
197
+ "step": 90
198
+ },
199
+ {
200
+ "loss": 0.32566983699798585,
201
+ "grad_norm": 0.013686278834939003,
202
+ "learning_rate": 8.974093264248706e-06,
203
+ "entropy": 0.7407993375349906,
204
+ "num_tokens": 6710899.0,
205
+ "logits/chosen": -1.491155676700035,
206
+ "logits/rejected": -1.1507826984501721,
207
+ "mean_token_accuracy": 0.7010396635532379,
208
+ "rewards/chosen": -1.472484585774364,
209
+ "rewards/rejected": -3.0050534189864995,
210
+ "rewards/accuracies": 0.87375,
211
+ "rewards/margins": 1.5325688306987286,
212
+ "logps/chosen": -71.50509068489075,
213
+ "logps/rejected": -79.74594541549682,
214
+ "epoch": 0.10372905969607385,
215
+ "step": 100
216
+ },
217
+ {
218
+ "loss": 0.3260276556015015,
219
+ "grad_norm": 0.015970611944794655,
220
+ "learning_rate": 8.870466321243523e-06,
221
+ "entropy": 0.755189473812934,
222
+ "num_tokens": 7384308.0,
223
+ "logits/chosen": -1.4866158399686538,
224
+ "logits/rejected": -1.2556732947348208,
225
+ "mean_token_accuracy": 0.6936355204880238,
226
+ "rewards/chosen": -1.6455462214258296,
227
+ "rewards/rejected": -3.314337354162708,
228
+ "rewards/accuracies": 0.875,
229
+ "rewards/margins": 1.6687911279685794,
230
+ "logps/chosen": -75.27282932758331,
231
+ "logps/rejected": -83.60757318258285,
232
+ "epoch": 0.11410196566568125,
233
+ "step": 110
234
+ },
235
+ {
236
+ "loss": 0.29123826026916505,
237
+ "grad_norm": 0.011552904732525349,
238
+ "learning_rate": 8.766839378238343e-06,
239
+ "entropy": 0.7474201882537455,
240
+ "num_tokens": 8056453.0,
241
+ "logits/chosen": -1.6142062577777776,
242
+ "logits/rejected": -1.264399125865953,
243
+ "mean_token_accuracy": 0.7005275747552514,
244
+ "rewards/chosen": -1.5997523294587155,
245
+ "rewards/rejected": -3.4206406278908252,
246
+ "rewards/accuracies": 0.89875,
247
+ "rewards/margins": 1.8208882979303598,
248
+ "logps/chosen": -72.69924384593963,
249
+ "logps/rejected": -84.9409653043747,
250
+ "epoch": 0.12447487163528863,
251
+ "step": 120
252
+ },
253
+ {
254
+ "eval_loss": 0.5006195306777954,
255
+ "eval_runtime": 185.028,
256
+ "eval_samples_per_second": 5.405,
257
+ "eval_steps_per_second": 5.405,
258
+ "eval_entropy": 0.7257204860020429,
259
+ "eval_num_tokens": 8393345.0,
260
+ "eval_logits/chosen": -1.6364654488183503,
261
+ "eval_logits/rejected": -1.3224665456826323,
262
+ "eval_mean_token_accuracy": 0.6896886819005013,
263
+ "eval_rewards/chosen": -1.8563280573266092,
264
+ "eval_rewards/rejected": -3.186325779806066,
265
+ "eval_rewards/accuracies": 0.791,
266
+ "eval_rewards/margins": 1.329997718065977,
267
+ "eval_logps/chosen": -68.73626706314087,
268
+ "eval_logps/rejected": -84.50312891960144,
269
+ "epoch": 0.1296613246200923,
270
+ "step": 125
271
+ },
272
+ {
273
+ "loss": 0.2636831045150757,
274
+ "grad_norm": 0.013076480478048325,
275
+ "learning_rate": 8.663212435233162e-06,
276
+ "entropy": 0.7181003772222903,
277
+ "num_tokens": 8728634.0,
278
+ "logits/chosen": -1.671642872950834,
279
+ "logits/rejected": -1.343902642880392,
280
+ "mean_token_accuracy": 0.705937882065773,
281
+ "rewards/chosen": -1.5789886895833478,
282
+ "rewards/rejected": -3.5362877251021563,
283
+ "rewards/accuracies": 0.90625,
284
+ "rewards/margins": 1.9572990308701992,
285
+ "logps/chosen": -72.90494430541992,
286
+ "logps/rejected": -84.75396874666214,
287
+ "epoch": 0.13484777760489602,
288
+ "step": 130
289
+ },
290
+ {
291
+ "loss": 0.2740552186965942,
292
+ "grad_norm": 0.021369587630033493,
293
+ "learning_rate": 8.55958549222798e-06,
294
+ "entropy": 0.7297478528990178,
295
+ "num_tokens": 9401159.0,
296
+ "logits/chosen": -1.7250535840926815,
297
+ "logits/rejected": -1.360942676206459,
298
+ "mean_token_accuracy": 0.7058176286891102,
299
+ "rewards/chosen": -1.711061445976993,
300
+ "rewards/rejected": -3.760642220210284,
301
+ "rewards/accuracies": 0.89875,
302
+ "rewards/margins": 2.0495807684585454,
303
+ "logps/chosen": -75.34392234086991,
304
+ "logps/rejected": -86.37021635055542,
305
+ "epoch": 0.1452206835745034,
306
+ "step": 140
307
+ },
308
+ {
309
+ "loss": 0.22246203422546387,
310
+ "grad_norm": 0.011216296814382076,
311
+ "learning_rate": 8.455958549222799e-06,
312
+ "entropy": 0.7156421507499181,
313
+ "num_tokens": 10070639.0,
314
+ "logits/chosen": -1.8058072450366334,
315
+ "logits/rejected": -1.453452492851942,
316
+ "mean_token_accuracy": 0.6968013681657612,
317
+ "rewards/chosen": -1.7734466221980256,
318
+ "rewards/rejected": -3.9852739233896135,
319
+ "rewards/accuracies": 0.935,
320
+ "rewards/margins": 2.2118273005262017,
321
+ "logps/chosen": -71.75837573051453,
322
+ "logps/rejected": -88.40371996164322,
323
+ "epoch": 0.1555935895441108,
324
+ "step": 150
325
+ },
326
+ {
327
+ "loss": 0.22982723712921144,
328
+ "grad_norm": 0.012776419520378113,
329
+ "learning_rate": 8.352331606217617e-06,
330
+ "entropy": 0.6933300006289209,
331
+ "num_tokens": 10739089.0,
332
+ "logits/chosen": -1.9515460256771149,
333
+ "logits/rejected": -1.5484639940247698,
334
+ "mean_token_accuracy": 0.7057104521989822,
335
+ "rewards/chosen": -1.9016535378903792,
336
+ "rewards/rejected": -4.284137947391718,
337
+ "rewards/accuracies": 0.92625,
338
+ "rewards/margins": 2.3824844037741424,
339
+ "logps/chosen": -71.04089045763016,
340
+ "logps/rejected": -91.5341923880577,
341
+ "epoch": 0.16596649551371817,
342
+ "step": 160
343
+ },
344
+ {
345
+ "loss": 0.23764348030090332,
346
+ "grad_norm": 0.014385406859219074,
347
+ "learning_rate": 8.248704663212436e-06,
348
+ "entropy": 0.7189149663675926,
349
+ "num_tokens": 11409834.0,
350
+ "logits/chosen": -1.891959825395243,
351
+ "logits/rejected": -1.548625273180476,
352
+ "mean_token_accuracy": 0.6981369163282216,
353
+ "rewards/chosen": -1.8744462743058101,
354
+ "rewards/rejected": -4.231724939988926,
355
+ "rewards/accuracies": 0.90875,
356
+ "rewards/margins": 2.3572786602377893,
357
+ "logps/chosen": -74.21431750059128,
358
+ "logps/rejected": -91.71514132022858,
359
+ "epoch": 0.17633940148332555,
360
+ "step": 170
361
+ },
362
+ {
363
+ "loss": 0.20213358402252196,
364
+ "grad_norm": 0.01709628663957119,
365
+ "learning_rate": 8.145077720207254e-06,
366
+ "entropy": 0.7331272099440684,
367
+ "num_tokens": 12080449.0,
368
+ "logits/chosen": -1.8974689940297265,
369
+ "logits/rejected": -1.5145953081096013,
370
+ "mean_token_accuracy": 0.6983240643888712,
371
+ "rewards/chosen": -1.801844048615967,
372
+ "rewards/rejected": -4.443616501316428,
373
+ "rewards/accuracies": 0.92875,
374
+ "rewards/margins": 2.6417724495008588,
375
+ "logps/chosen": -74.37266374826432,
376
+ "logps/rejected": -93.39013815402984,
377
+ "epoch": 0.18671230745293294,
378
+ "step": 180
379
+ },
380
+ {
381
+ "loss": 0.22085981369018554,
382
+ "grad_norm": 0.017351916059851646,
383
+ "learning_rate": 8.041450777202073e-06,
384
+ "entropy": 0.7038006630554446,
385
+ "num_tokens": 12750629.0,
386
+ "logits/chosen": -2.036204467140802,
387
+ "logits/rejected": -1.5767073775724174,
388
+ "mean_token_accuracy": 0.7034011324681342,
389
+ "rewards/chosen": -1.9227157408563653,
390
+ "rewards/rejected": -4.568975618286058,
391
+ "rewards/accuracies": 0.9175,
392
+ "rewards/margins": 2.6462598730251194,
393
+ "logps/chosen": -71.0266849398613,
394
+ "logps/rejected": -95.72787975311279,
395
+ "epoch": 0.19708521342254032,
396
+ "step": 190
397
+ },
398
+ {
399
+ "loss": 0.21095876693725585,
400
+ "grad_norm": 0.011923568323254585,
401
+ "learning_rate": 7.937823834196891e-06,
402
+ "entropy": 0.7554844116524327,
403
+ "num_tokens": 13423352.0,
404
+ "logits/chosen": -1.86974235439135,
405
+ "logits/rejected": -1.501746707999648,
406
+ "mean_token_accuracy": 0.6907317889854312,
407
+ "rewards/chosen": -1.9836193190991616,
408
+ "rewards/rejected": -4.729873430356383,
409
+ "rewards/accuracies": 0.92,
410
+ "rewards/margins": 2.7462541125901043,
411
+ "logps/chosen": -76.15088132619857,
412
+ "logps/rejected": -98.10042838811874,
413
+ "epoch": 0.2074581193921477,
414
+ "step": 200
415
+ },
416
+ {
417
+ "loss": 0.20679113864898682,
418
+ "grad_norm": 0.016088780015707016,
419
+ "learning_rate": 7.834196891191712e-06,
420
+ "entropy": 0.7792452401274932,
421
+ "num_tokens": 14095948.0,
422
+ "logits/chosen": -1.8705466560278834,
423
+ "logits/rejected": -1.461863531116033,
424
+ "mean_token_accuracy": 0.6862335817702114,
425
+ "rewards/chosen": -1.8493201506307742,
426
+ "rewards/rejected": -4.571774728436139,
427
+ "rewards/accuracies": 0.9275,
428
+ "rewards/margins": 2.7224545743037014,
429
+ "logps/chosen": -74.57652376651764,
430
+ "logps/rejected": -96.64638544797897,
431
+ "epoch": 0.2178310253617551,
432
+ "step": 210
433
+ },
434
+ {
435
+ "loss": 0.1841462254524231,
436
+ "grad_norm": 0.018083656206727028,
437
+ "learning_rate": 7.730569948186528e-06,
438
+ "entropy": 0.7562577223840344,
439
+ "num_tokens": 14765355.0,
440
+ "logits/chosen": -1.9466678828790673,
441
+ "logits/rejected": -1.556764617717985,
442
+ "mean_token_accuracy": 0.6736517621856183,
443
+ "rewards/chosen": -1.9498732457583536,
444
+ "rewards/rejected": -4.814249985329806,
445
+ "rewards/accuracies": 0.94375,
446
+ "rewards/margins": 2.8643767323717473,
447
+ "logps/chosen": -74.6550524687767,
448
+ "logps/rejected": -96.928872423172,
449
+ "epoch": 0.2282039313313625,
450
+ "step": 220
451
+ },
452
+ {
453
+ "loss": 0.18351367712020875,
454
+ "grad_norm": 0.02809528261423111,
455
+ "learning_rate": 7.626943005181348e-06,
456
+ "entropy": 0.7285784264818358,
457
+ "num_tokens": 15435816.0,
458
+ "logits/chosen": -2.0795930087592787,
459
+ "logits/rejected": -1.636840952128652,
460
+ "mean_token_accuracy": 0.6832175821252168,
461
+ "rewards/chosen": -2.231121272182354,
462
+ "rewards/rejected": -5.6053673730045555,
463
+ "rewards/accuracies": 0.935,
464
+ "rewards/margins": 3.374246101528406,
465
+ "logps/chosen": -77.43112219810486,
466
+ "logps/rejected": -106.47521061182022,
467
+ "epoch": 0.23857683730096987,
468
+ "step": 230
469
+ },
470
+ {
471
+ "loss": 0.19073803424835206,
472
+ "grad_norm": 0.01874386891722679,
473
+ "learning_rate": 7.523316062176167e-06,
474
+ "entropy": 0.7100621155637782,
475
+ "num_tokens": 16103129.0,
476
+ "logits/chosen": -2.111952753872817,
477
+ "logits/rejected": -1.7125841187317576,
478
+ "mean_token_accuracy": 0.6768746449425816,
479
+ "rewards/chosen": -2.3892388375883455,
480
+ "rewards/rejected": -5.755352979376912,
481
+ "rewards/accuracies": 0.935,
482
+ "rewards/margins": 3.366114140301943,
483
+ "logps/chosen": -76.3891685450077,
484
+ "logps/rejected": -104.74123107671738,
485
+ "epoch": 0.24894974327057726,
486
+ "step": 240
487
+ },
488
+ {
489
+ "loss": 0.15556421279907226,
490
+ "grad_norm": 0.01747226156294346,
491
+ "learning_rate": 7.419689119170985e-06,
492
+ "entropy": 0.733566192787257,
493
+ "num_tokens": 16774426.0,
494
+ "logits/chosen": -1.9979488002914059,
495
+ "logits/rejected": -1.5990273070071686,
496
+ "mean_token_accuracy": 0.6710057172738015,
497
+ "rewards/chosen": -2.2422293889999856,
498
+ "rewards/rejected": -5.71058324098587,
499
+ "rewards/accuracies": 0.95125,
500
+ "rewards/margins": 3.4683538476377724,
501
+ "logps/chosen": -77.04140710353852,
502
+ "logps/rejected": -106.12069250583649,
503
+ "epoch": 0.2593226492401846,
504
+ "step": 250
505
+ },
506
+ {
507
+ "eval_loss": 0.6056406497955322,
508
+ "eval_runtime": 214.9765,
509
+ "eval_samples_per_second": 4.652,
510
+ "eval_steps_per_second": 4.652,
511
+ "eval_entropy": 0.7675776538113133,
512
+ "eval_num_tokens": 16774426.0,
513
+ "eval_logits/chosen": -1.9016790324834714,
514
+ "eval_logits/rejected": -1.5678728323483735,
515
+ "eval_mean_token_accuracy": 0.638426756888628,
516
+ "eval_rewards/chosen": -2.858136704711709,
517
+ "eval_rewards/rejected": -5.103179955605418,
518
+ "eval_rewards/accuracies": 0.779,
519
+ "eval_rewards/margins": 2.245043248832226,
520
+ "eval_logps/chosen": -78.75435346412658,
521
+ "eval_logps/rejected": -103.67167038726807,
522
+ "epoch": 0.2593226492401846,
523
+ "step": 250
524
+ },
525
+ {
526
+ "loss": 0.15468125343322753,
527
+ "grad_norm": 0.023065408691763878,
528
+ "learning_rate": 7.3160621761658035e-06,
529
+ "entropy": 0.7432888356089825,
530
+ "num_tokens": 17443716.0,
531
+ "logits/chosen": -2.0815265223306243,
532
+ "logits/rejected": -1.6500056931946074,
533
+ "mean_token_accuracy": 0.665775734577328,
534
+ "rewards/chosen": -2.3973246609413765,
535
+ "rewards/rejected": -5.997232149764895,
536
+ "rewards/accuracies": 0.95,
537
+ "rewards/margins": 3.599907489940524,
538
+ "logps/chosen": -77.37100106954574,
539
+ "logps/rejected": -108.72272551059723,
540
+ "epoch": 0.26969555520979205,
541
+ "step": 260
542
+ },
543
+ {
544
+ "loss": 0.17242192029953002,
545
+ "grad_norm": 0.018100790679454803,
546
+ "learning_rate": 7.212435233160623e-06,
547
+ "entropy": 0.7815824018983403,
548
+ "num_tokens": 18115456.0,
549
+ "logits/chosen": -1.8929626691100117,
550
+ "logits/rejected": -1.568634429940542,
551
+ "mean_token_accuracy": 0.6482958744466305,
552
+ "rewards/chosen": -2.8240217579288767,
553
+ "rewards/rejected": -6.417929985076189,
554
+ "rewards/accuracies": 0.93875,
555
+ "rewards/margins": 3.593908224105835,
556
+ "logps/chosen": -86.06786829471588,
557
+ "logps/rejected": -114.08773995637894,
558
+ "epoch": 0.28006846117939943,
559
+ "step": 270
560
+ },
561
+ {
562
+ "loss": 0.13711202144622803,
563
+ "grad_norm": 0.013445369899272919,
564
+ "learning_rate": 7.108808290155441e-06,
565
+ "entropy": 0.7558632073167246,
566
+ "num_tokens": 18787182.0,
567
+ "logits/chosen": -1.978579450117466,
568
+ "logits/rejected": -1.6631533533075546,
569
+ "mean_token_accuracy": 0.6569508682191372,
570
+ "rewards/chosen": -2.7565071246563457,
571
+ "rewards/rejected": -6.632811545878649,
572
+ "rewards/accuracies": 0.9575,
573
+ "rewards/margins": 3.8763044214993716,
574
+ "logps/chosen": -84.94609524965286,
575
+ "logps/rejected": -115.75064901828766,
576
+ "epoch": 0.2904413671490068,
577
+ "step": 280
578
+ },
579
+ {
580
+ "loss": 0.14471136331558226,
581
+ "grad_norm": 0.03034352697432041,
582
+ "learning_rate": 7.005181347150259e-06,
583
+ "entropy": 0.7719684389990289,
584
+ "num_tokens": 19458826.0,
585
+ "logits/chosen": -1.9281082628928359,
586
+ "logits/rejected": -1.5931914351338883,
587
+ "mean_token_accuracy": 0.6512335392460227,
588
+ "rewards/chosen": -3.03531946905714,
589
+ "rewards/rejected": -7.0661579599231485,
590
+ "rewards/accuracies": 0.94875,
591
+ "rewards/margins": 4.030838481113315,
592
+ "logps/chosen": -85.57453865528106,
593
+ "logps/rejected": -120.38242918252945,
594
+ "epoch": 0.3008142731186142,
595
+ "step": 290
596
+ },
597
+ {
598
+ "loss": 0.14207189083099364,
599
+ "grad_norm": 0.01976640149950981,
600
+ "learning_rate": 6.9015544041450784e-06,
601
+ "entropy": 0.775840242926497,
602
+ "num_tokens": 20129807.0,
603
+ "logits/chosen": -1.9291908069467354,
604
+ "logits/rejected": -1.529736851381803,
605
+ "mean_token_accuracy": 0.647318363133818,
606
+ "rewards/chosen": -3.2047973467002158,
607
+ "rewards/rejected": -7.190337324440479,
608
+ "rewards/accuracies": 0.94375,
609
+ "rewards/margins": 3.985539976321161,
610
+ "logps/chosen": -88.11508201122284,
611
+ "logps/rejected": -121.52326109170913,
612
+ "epoch": 0.3111871790882216,
613
+ "step": 300
614
+ },
615
+ {
616
+ "loss": 0.13882720470428467,
617
+ "grad_norm": 0.019125595688819885,
618
+ "learning_rate": 6.797927461139897e-06,
619
+ "entropy": 0.7558516392938327,
620
+ "num_tokens": 20801777.0,
621
+ "logits/chosen": -1.9366754550881657,
622
+ "logits/rejected": -1.5732930849415423,
623
+ "mean_token_accuracy": 0.6629200987983495,
624
+ "rewards/chosen": -3.214626377870736,
625
+ "rewards/rejected": -7.299282197505236,
626
+ "rewards/accuracies": 0.9475,
627
+ "rewards/margins": 4.084655814617872,
628
+ "logps/chosen": -88.43090007543564,
629
+ "logps/rejected": -121.64797079086304,
630
+ "epoch": 0.32156008505782896,
631
+ "step": 310
632
+ },
633
+ {
634
+ "loss": 0.15239068269729614,
635
+ "grad_norm": 0.026703625917434692,
636
+ "learning_rate": 6.6943005181347155e-06,
637
+ "entropy": 0.759519019573927,
638
+ "num_tokens": 21473384.0,
639
+ "logits/chosen": -1.9384710945696861,
640
+ "logits/rejected": -1.6229014066134837,
641
+ "mean_token_accuracy": 0.6460824762284756,
642
+ "rewards/chosen": -3.5289745971094817,
643
+ "rewards/rejected": -7.814981915429234,
644
+ "rewards/accuracies": 0.9425,
645
+ "rewards/margins": 4.286007315814495,
646
+ "logps/chosen": -95.04349534749984,
647
+ "logps/rejected": -127.0398188662529,
648
+ "epoch": 0.33193299102743634,
649
+ "step": 320
650
+ },
651
+ {
652
+ "loss": 0.13009344339370726,
653
+ "grad_norm": 0.018585270270705223,
654
+ "learning_rate": 6.590673575129535e-06,
655
+ "entropy": 0.7342186298122396,
656
+ "num_tokens": 22142477.0,
657
+ "logits/chosen": -2.0363266451123923,
658
+ "logits/rejected": -1.67308820389407,
659
+ "mean_token_accuracy": 0.6532345769926906,
660
+ "rewards/chosen": -3.3065084332806873,
661
+ "rewards/rejected": -7.662135322336107,
662
+ "rewards/accuracies": 0.95625,
663
+ "rewards/margins": 4.355626890957356,
664
+ "logps/chosen": -86.15242535829545,
665
+ "logps/rejected": -125.1262379026413,
666
+ "epoch": 0.3423058969970437,
667
+ "step": 330
668
+ },
669
+ {
670
+ "loss": 0.1294613003730774,
671
+ "grad_norm": 0.024174772202968597,
672
+ "learning_rate": 6.487046632124353e-06,
673
+ "entropy": 0.778732093811268,
674
+ "num_tokens": 22814406.0,
675
+ "logits/chosen": -1.8744846753614508,
676
+ "logits/rejected": -1.557779354695435,
677
+ "mean_token_accuracy": 0.6483545247651636,
678
+ "rewards/chosen": -3.3343913850979243,
679
+ "rewards/rejected": -7.493394564837217,
680
+ "rewards/accuracies": 0.95625,
681
+ "rewards/margins": 4.1590031705796715,
682
+ "logps/chosen": -91.52018271446228,
683
+ "logps/rejected": -125.49517280578613,
684
+ "epoch": 0.3526788029666511,
685
+ "step": 340
686
+ },
687
+ {
688
+ "loss": 0.12839078903198242,
689
+ "grad_norm": 0.021780716255307198,
690
+ "learning_rate": 6.383419689119171e-06,
691
+ "entropy": 0.7516101838089526,
692
+ "num_tokens": 23486707.0,
693
+ "logits/chosen": -1.9700945184752572,
694
+ "logits/rejected": -1.6397432545695403,
695
+ "mean_token_accuracy": 0.6522356096096337,
696
+ "rewards/chosen": -3.294995879915514,
697
+ "rewards/rejected": -7.7126641423255204,
698
+ "rewards/accuracies": 0.9575,
699
+ "rewards/margins": 4.4176682551950215,
700
+ "logps/chosen": -90.83600348949432,
701
+ "logps/rejected": -126.77610003948212,
702
+ "epoch": 0.3630517089362585,
703
+ "step": 350
704
+ },
705
+ {
706
+ "loss": 0.1488456130027771,
707
+ "grad_norm": 0.020714374259114265,
708
+ "learning_rate": 6.2797927461139905e-06,
709
+ "entropy": 0.7544214495958295,
710
+ "num_tokens": 24156469.0,
711
+ "logits/chosen": -1.92354159972201,
712
+ "logits/rejected": -1.5932112088234438,
713
+ "mean_token_accuracy": 0.6473389553651213,
714
+ "rewards/chosen": -3.2932736888423095,
715
+ "rewards/rejected": -7.400682945102453,
716
+ "rewards/accuracies": 0.945,
717
+ "rewards/margins": 4.107409240156412,
718
+ "logps/chosen": -88.0268507552147,
719
+ "logps/rejected": -122.07945943832398,
720
+ "epoch": 0.37342461490586587,
721
+ "step": 360
722
+ },
723
+ {
724
+ "loss": 0.12627313137054444,
725
+ "grad_norm": 0.01646515727043152,
726
+ "learning_rate": 6.176165803108809e-06,
727
+ "entropy": 0.8060684028314427,
728
+ "num_tokens": 24831471.0,
729
+ "logits/chosen": -1.7544659981832322,
730
+ "logits/rejected": -1.463259412146846,
731
+ "mean_token_accuracy": 0.6474123366177083,
732
+ "rewards/chosen": -3.231792522999458,
733
+ "rewards/rejected": -7.640311172902584,
734
+ "rewards/accuracies": 0.95875,
735
+ "rewards/margins": 4.408518632799387,
736
+ "logps/chosen": -94.10357024669648,
737
+ "logps/rejected": -128.06225858926774,
738
+ "epoch": 0.38379752087547325,
739
+ "step": 370
740
+ },
741
+ {
742
+ "eval_loss": 0.7162045836448669,
743
+ "eval_runtime": 245.5758,
744
+ "eval_samples_per_second": 4.072,
745
+ "eval_steps_per_second": 4.072,
746
+ "eval_entropy": 0.7526722595356404,
747
+ "eval_num_tokens": 25165755.0,
748
+ "eval_logits/chosen": -1.90159736974585,
749
+ "eval_logits/rejected": -1.5791501459591346,
750
+ "eval_mean_token_accuracy": 0.6217855967730284,
751
+ "eval_rewards/chosen": -4.221462745887227,
752
+ "eval_rewards/rejected": -7.149939286857843,
753
+ "eval_rewards/accuracies": 0.783,
754
+ "eval_rewards/margins": 2.9284765325784683,
755
+ "eval_logps/chosen": -92.38761359214783,
756
+ "eval_logps/rejected": -124.13926333999633,
757
+ "epoch": 0.38898397386027694,
758
+ "step": 375
759
+ },
760
+ {
761
+ "loss": 0.12565295696258544,
762
+ "grad_norm": 0.023654216900467873,
763
+ "learning_rate": 6.0725388601036275e-06,
764
+ "entropy": 0.7168624554201961,
765
+ "num_tokens": 25500679.0,
766
+ "logits/chosen": -2.056052749523911,
767
+ "logits/rejected": -1.643372895075378,
768
+ "mean_token_accuracy": 0.6568564863596111,
769
+ "rewards/chosen": -3.4278560562586065,
770
+ "rewards/rejected": -7.977554326504469,
771
+ "rewards/accuracies": 0.95,
772
+ "rewards/margins": 4.549698264449835,
773
+ "logps/chosen": -86.61842272043228,
774
+ "logps/rejected": -128.30167908906935,
775
+ "epoch": 0.39417042684508063,
776
+ "step": 380
777
+ },
778
+ {
779
+ "loss": 0.11409251689910889,
780
+ "grad_norm": 0.024783629924058914,
781
+ "learning_rate": 5.968911917098445e-06,
782
+ "entropy": 0.7501401096500921,
783
+ "num_tokens": 26171757.0,
784
+ "logits/chosen": -1.9333745257284571,
785
+ "logits/rejected": -1.567348165840012,
786
+ "mean_token_accuracy": 0.6470369586162269,
787
+ "rewards/chosen": -3.536213577263552,
788
+ "rewards/rejected": -8.32627578780055,
789
+ "rewards/accuracies": 0.96,
790
+ "rewards/margins": 4.790062201619148,
791
+ "logps/chosen": -91.70740163564682,
792
+ "logps/rejected": -133.4269912481308,
793
+ "epoch": 0.404543332814688,
794
+ "step": 390
795
+ },
796
+ {
797
+ "loss": 0.10429913997650146,
798
+ "grad_norm": 0.01578158512711525,
799
+ "learning_rate": 5.865284974093265e-06,
800
+ "entropy": 0.7956635004619602,
801
+ "num_tokens": 26844715.0,
802
+ "logits/chosen": -1.8049366638144833,
803
+ "logits/rejected": -1.5104901431761746,
804
+ "mean_token_accuracy": 0.6389342303480953,
805
+ "rewards/chosen": -3.4948488865431866,
806
+ "rewards/rejected": -8.024183837622404,
807
+ "rewards/accuracies": 0.96375,
808
+ "rewards/margins": 4.529334946647286,
809
+ "logps/chosen": -94.648166680336,
810
+ "logps/rejected": -130.52285103082656,
811
+ "epoch": 0.4149162387842954,
812
+ "step": 400
813
+ },
814
+ {
815
+ "loss": 0.13800268173217772,
816
+ "grad_norm": 0.019957033917307854,
817
+ "learning_rate": 5.761658031088083e-06,
818
+ "entropy": 0.7793120911484585,
819
+ "num_tokens": 27516725.0,
820
+ "logits/chosen": -1.8549602335857083,
821
+ "logits/rejected": -1.5267175160987139,
822
+ "mean_token_accuracy": 0.6423193990625441,
823
+ "rewards/chosen": -3.492969937432499,
824
+ "rewards/rejected": -8.126144999023527,
825
+ "rewards/accuracies": 0.96125,
826
+ "rewards/margins": 4.633175050020218,
827
+ "logps/chosen": -93.58816482782363,
828
+ "logps/rejected": -131.41816306352615,
829
+ "epoch": 0.4252891447539028,
830
+ "step": 410
831
+ },
832
+ {
833
+ "loss": 0.11805713176727295,
834
+ "grad_norm": 0.0187994334846735,
835
+ "learning_rate": 5.658031088082902e-06,
836
+ "entropy": 0.7545757652306929,
837
+ "num_tokens": 28188135.0,
838
+ "logits/chosen": -1.873550110920591,
839
+ "logits/rejected": -1.5043320525754367,
840
+ "mean_token_accuracy": 0.6394615587592125,
841
+ "rewards/chosen": -3.3145995734280405,
842
+ "rewards/rejected": -7.947769758999348,
843
+ "rewards/accuracies": 0.9575,
844
+ "rewards/margins": 4.633170171380043,
845
+ "logps/chosen": -87.63653787136077,
846
+ "logps/rejected": -129.56220105171204,
847
+ "epoch": 0.4356620507235102,
848
+ "step": 420
849
+ },
850
+ {
851
+ "loss": 0.12740592956542968,
852
+ "grad_norm": 0.01738053746521473,
853
+ "learning_rate": 5.554404145077721e-06,
854
+ "entropy": 0.75883277257788,
855
+ "num_tokens": 28858804.0,
856
+ "logits/chosen": -1.9298376085920284,
857
+ "logits/rejected": -1.560056586818597,
858
+ "mean_token_accuracy": 0.6475845011882484,
859
+ "rewards/chosen": -3.515412328981329,
860
+ "rewards/rejected": -8.071005233377218,
861
+ "rewards/accuracies": 0.96,
862
+ "rewards/margins": 4.555592897236347,
863
+ "logps/chosen": -92.735348944664,
864
+ "logps/rejected": -129.75473901987075,
865
+ "epoch": 0.4460349566931176,
866
+ "step": 430
867
+ },
868
+ {
869
+ "loss": 0.14025732278823852,
870
+ "grad_norm": 0.03447360917925835,
871
+ "learning_rate": 5.4507772020725395e-06,
872
+ "entropy": 0.7607411430426874,
873
+ "num_tokens": 29529999.0,
874
+ "logits/chosen": -1.8672980078366863,
875
+ "logits/rejected": -1.5365591751796719,
876
+ "mean_token_accuracy": 0.6453877515532076,
877
+ "rewards/chosen": -3.5431255162111484,
878
+ "rewards/rejected": -8.013637196272612,
879
+ "rewards/accuracies": 0.94625,
880
+ "rewards/margins": 4.4705116748809814,
881
+ "logps/chosen": -93.00428878068924,
882
+ "logps/rejected": -129.0281007218361,
883
+ "epoch": 0.456407862662725,
884
+ "step": 440
885
+ },
886
+ {
887
+ "loss": 0.09569562077522278,
888
+ "grad_norm": 0.019115449860692024,
889
+ "learning_rate": 5.347150259067357e-06,
890
+ "entropy": 0.787961185129825,
891
+ "num_tokens": 30203505.0,
892
+ "logits/chosen": -1.9089318864847349,
893
+ "logits/rejected": -1.4739854222647117,
894
+ "mean_token_accuracy": 0.654497133269906,
895
+ "rewards/chosen": -3.3072420401062117,
896
+ "rewards/rejected": -8.128699697032571,
897
+ "rewards/accuracies": 0.97375,
898
+ "rewards/margins": 4.821457646489144,
899
+ "logps/chosen": -90.26756436109542,
900
+ "logps/rejected": -133.00522322177886,
901
+ "epoch": 0.46678076863233237,
902
+ "step": 450
903
+ },
904
+ {
905
+ "loss": 0.12792205810546875,
906
+ "grad_norm": 0.0281841903924942,
907
+ "learning_rate": 5.243523316062177e-06,
908
+ "entropy": 0.766239798675524,
909
+ "num_tokens": 30875568.0,
910
+ "logits/chosen": -1.9169137057827605,
911
+ "logits/rejected": -1.5443000783572756,
912
+ "mean_token_accuracy": 0.6505569527018815,
913
+ "rewards/chosen": -3.42417212592205,
914
+ "rewards/rejected": -8.022385044395923,
915
+ "rewards/accuracies": 0.95375,
916
+ "rewards/margins": 4.598212912380696,
917
+ "logps/chosen": -88.34398028373718,
918
+ "logps/rejected": -130.9107288122177,
919
+ "epoch": 0.47715367460193975,
920
+ "step": 460
921
+ },
922
+ {
923
+ "loss": 0.10438011884689331,
924
+ "grad_norm": 0.012769816443324089,
925
+ "learning_rate": 5.139896373056995e-06,
926
+ "entropy": 0.754261478689732,
927
+ "num_tokens": 31547801.0,
928
+ "logits/chosen": -1.9733235777624498,
929
+ "logits/rejected": -1.5496449682143498,
930
+ "mean_token_accuracy": 0.6587452093698084,
931
+ "rewards/chosen": -3.4046586474310607,
932
+ "rewards/rejected": -8.238689427375794,
933
+ "rewards/accuracies": 0.96,
934
+ "rewards/margins": 4.8340307791531085,
935
+ "logps/chosen": -90.22236561775208,
936
+ "logps/rejected": -133.67569626569747,
937
+ "epoch": 0.48752658057154713,
938
+ "step": 470
939
+ },
940
+ {
941
+ "loss": 0.11527338027954101,
942
+ "grad_norm": 0.04143095761537552,
943
+ "learning_rate": 5.036269430051814e-06,
944
+ "entropy": 0.8031201446475461,
945
+ "num_tokens": 32220905.0,
946
+ "logits/chosen": -1.8379997780593569,
947
+ "logits/rejected": -1.5025386930087672,
948
+ "mean_token_accuracy": 0.6306095580849796,
949
+ "rewards/chosen": -3.4276347397238713,
950
+ "rewards/rejected": -8.276202333420516,
951
+ "rewards/accuracies": 0.96,
952
+ "rewards/margins": 4.848567594140768,
953
+ "logps/chosen": -95.14371522426605,
954
+ "logps/rejected": -134.20426798820495,
955
+ "epoch": 0.4978994865411545,
956
+ "step": 480
957
+ },
958
+ {
959
+ "loss": 0.13075348138809204,
960
+ "grad_norm": 0.011864494532346725,
961
+ "learning_rate": 4.932642487046633e-06,
962
+ "entropy": 0.7831255796179175,
963
+ "num_tokens": 32894872.0,
964
+ "logits/chosen": -1.8320905121355995,
965
+ "logits/rejected": -1.4693764522144144,
966
+ "mean_token_accuracy": 0.6478395171277225,
967
+ "rewards/chosen": -3.2756898268085206,
968
+ "rewards/rejected": -7.780137736238539,
969
+ "rewards/accuracies": 0.955,
970
+ "rewards/margins": 4.504447904080153,
971
+ "logps/chosen": -91.73629876852036,
972
+ "logps/rejected": -129.0320829319954,
973
+ "epoch": 0.5082723925107618,
974
+ "step": 490
975
+ },
976
+ {
977
+ "loss": 0.12714189291000366,
978
+ "grad_norm": 0.02473694644868374,
979
+ "learning_rate": 4.829015544041451e-06,
980
+ "entropy": 0.7955848192726261,
981
+ "num_tokens": 33565691.0,
982
+ "logits/chosen": -1.8834938774520926,
983
+ "logits/rejected": -1.4981447820382991,
984
+ "mean_token_accuracy": 0.6382771720923484,
985
+ "rewards/chosen": -3.1717117047600913,
986
+ "rewards/rejected": -7.624671882167458,
987
+ "rewards/accuracies": 0.9575,
988
+ "rewards/margins": 4.452960164994002,
989
+ "logps/chosen": -87.47686364412307,
990
+ "logps/rejected": -125.46468779563904,
991
+ "epoch": 0.5186452984803692,
992
+ "step": 500
993
+ },
994
+ {
995
+ "eval_loss": 0.6964932084083557,
996
+ "eval_runtime": 279.8952,
997
+ "eval_samples_per_second": 3.573,
998
+ "eval_steps_per_second": 3.573,
999
+ "eval_entropy": 0.7739749677795916,
1000
+ "eval_num_tokens": 33565691.0,
1001
+ "eval_logits/chosen": -1.8410994007704304,
1002
+ "eval_logits/rejected": -1.4860494630066636,
1003
+ "eval_mean_token_accuracy": 0.6207611305266618,
1004
+ "eval_rewards/chosen": -3.7967804961130023,
1005
+ "eval_rewards/rejected": -6.769779369160533,
1006
+ "eval_rewards/accuracies": 0.793,
1007
+ "eval_rewards/margins": 2.9729988664388656,
1008
+ "eval_logps/chosen": -88.14079112052917,
1009
+ "eval_logps/rejected": -120.33766422653198,
1010
+ "epoch": 0.5186452984803692,
1011
+ "step": 500
1012
+ },
1013
+ {
1014
+ "train_runtime": 16864.5913,
1015
+ "train_samples_per_second": 4.573,
1016
+ "train_steps_per_second": 0.057,
1017
+ "total_flos": 2.7163725934432666e+17,
1018
+ "train_loss": 0.23282903826236725,
1019
+ "epoch": 0.5186452984803692,
1020
+ "step": 500
1021
+ }
1022
+ ],
1023
+ "validation_monitor_size": 1000,
1024
+ "validation_monitor_selection": "fixed_seed_random_without_replacement",
1025
+ "validation_monitor_seed": 22,
1026
+ "validation_monitor_indices": [
1027
+ 2,
1028
+ 10,
1029
+ 14,
1030
+ 21,
1031
+ 55,
1032
+ 63,
1033
+ 66,
1034
+ 69,
1035
+ 107,
1036
+ 110,
1037
+ 142,
1038
+ 144,
1039
+ 149,
1040
+ 150,
1041
+ 151,
1042
+ 152,
1043
+ 160,
1044
+ 163,
1045
+ 166,
1046
+ 167,
1047
+ 176,
1048
+ 181,
1049
+ 206,
1050
+ 207,
1051
+ 259,
1052
+ 267,
1053
+ 281,
1054
+ 295,
1055
+ 298,
1056
+ 306,
1057
+ 307,
1058
+ 317,
1059
+ 321,
1060
+ 331,
1061
+ 336,
1062
+ 341,
1063
+ 346,
1064
+ 349,
1065
+ 351,
1066
+ 352,
1067
+ 357,
1068
+ 358,
1069
+ 369,
1070
+ 370,
1071
+ 382,
1072
+ 386,
1073
+ 391,
1074
+ 401,
1075
+ 411,
1076
+ 412,
1077
+ 432,
1078
+ 437,
1079
+ 452,
1080
+ 462,
1081
+ 465,
1082
+ 488,
1083
+ 490,
1084
+ 491,
1085
+ 492,
1086
+ 494,
1087
+ 503,
1088
+ 504,
1089
+ 508,
1090
+ 528,
1091
+ 538,
1092
+ 540,
1093
+ 551,
1094
+ 553,
1095
+ 567,
1096
+ 586,
1097
+ 605,
1098
+ 606,
1099
+ 625,
1100
+ 627,
1101
+ 661,
1102
+ 663,
1103
+ 666,
1104
+ 677,
1105
+ 685,
1106
+ 690,
1107
+ 692,
1108
+ 704,
1109
+ 708,
1110
+ 714,
1111
+ 715,
1112
+ 727,
1113
+ 728,
1114
+ 733,
1115
+ 745,
1116
+ 752,
1117
+ 753,
1118
+ 755,
1119
+ 764,
1120
+ 773,
1121
+ 779,
1122
+ 783,
1123
+ 793,
1124
+ 796,
1125
+ 799,
1126
+ 803,
1127
+ 804,
1128
+ 805,
1129
+ 813,
1130
+ 816,
1131
+ 818,
1132
+ 823,
1133
+ 827,
1134
+ 829,
1135
+ 830,
1136
+ 837,
1137
+ 842,
1138
+ 845,
1139
+ 850,
1140
+ 853,
1141
+ 856,
1142
+ 889,
1143
+ 890,
1144
+ 905,
1145
+ 915,
1146
+ 924,
1147
+ 930,
1148
+ 939,
1149
+ 951,
1150
+ 988,
1151
+ 1002,
1152
+ 1005,
1153
+ 1023,
1154
+ 1029,
1155
+ 1038,
1156
+ 1049,
1157
+ 1050,
1158
+ 1054,
1159
+ 1056,
1160
+ 1067,
1161
+ 1068,
1162
+ 1079,
1163
+ 1088,
1164
+ 1091,
1165
+ 1103,
1166
+ 1114,
1167
+ 1118,
1168
+ 1133,
1169
+ 1140,
1170
+ 1144,
1171
+ 1145,
1172
+ 1155,
1173
+ 1186,
1174
+ 1195,
1175
+ 1206,
1176
+ 1223,
1177
+ 1251,
1178
+ 1252,
1179
+ 1257,
1180
+ 1259,
1181
+ 1270,
1182
+ 1271,
1183
+ 1295,
1184
+ 1303,
1185
+ 1304,
1186
+ 1305,
1187
+ 1329,
1188
+ 1335,
1189
+ 1336,
1190
+ 1343,
1191
+ 1367,
1192
+ 1373,
1193
+ 1377,
1194
+ 1403,
1195
+ 1412,
1196
+ 1429,
1197
+ 1443,
1198
+ 1457,
1199
+ 1459,
1200
+ 1460,
1201
+ 1476,
1202
+ 1483,
1203
+ 1486,
1204
+ 1494,
1205
+ 1507,
1206
+ 1510,
1207
+ 1519,
1208
+ 1521,
1209
+ 1522,
1210
+ 1545,
1211
+ 1551,
1212
+ 1570,
1213
+ 1582,
1214
+ 1593,
1215
+ 1595,
1216
+ 1603,
1217
+ 1607,
1218
+ 1614,
1219
+ 1615,
1220
+ 1625,
1221
+ 1634,
1222
+ 1639,
1223
+ 1648,
1224
+ 1654,
1225
+ 1657,
1226
+ 1662,
1227
+ 1667,
1228
+ 1673,
1229
+ 1690,
1230
+ 1704,
1231
+ 1746,
1232
+ 1756,
1233
+ 1781,
1234
+ 1783,
1235
+ 1796,
1236
+ 1799,
1237
+ 1809,
1238
+ 1814,
1239
+ 1827,
1240
+ 1829,
1241
+ 1832,
1242
+ 1844,
1243
+ 1847,
1244
+ 1854,
1245
+ 1856,
1246
+ 1857,
1247
+ 1858,
1248
+ 1874,
1249
+ 1883,
1250
+ 1889,
1251
+ 1924,
1252
+ 1925,
1253
+ 1931,
1254
+ 1932,
1255
+ 1934,
1256
+ 1935,
1257
+ 1938,
1258
+ 1950,
1259
+ 1957,
1260
+ 1962,
1261
+ 1967,
1262
+ 1975,
1263
+ 1982,
1264
+ 1983,
1265
+ 1991,
1266
+ 1998,
1267
+ 2003,
1268
+ 2008,
1269
+ 2017,
1270
+ 2021,
1271
+ 2026,
1272
+ 2035,
1273
+ 2040,
1274
+ 2050,
1275
+ 2056,
1276
+ 2077,
1277
+ 2079,
1278
+ 2082,
1279
+ 2098,
1280
+ 2100,
1281
+ 2108,
1282
+ 2121,
1283
+ 2130,
1284
+ 2133,
1285
+ 2134,
1286
+ 2138,
1287
+ 2143,
1288
+ 2166,
1289
+ 2167,
1290
+ 2180,
1291
+ 2181,
1292
+ 2185,
1293
+ 2204,
1294
+ 2205,
1295
+ 2212,
1296
+ 2221,
1297
+ 2224,
1298
+ 2226,
1299
+ 2230,
1300
+ 2233,
1301
+ 2256,
1302
+ 2261,
1303
+ 2263,
1304
+ 2269,
1305
+ 2273,
1306
+ 2290,
1307
+ 2291,
1308
+ 2299,
1309
+ 2301,
1310
+ 2321,
1311
+ 2323,
1312
+ 2330,
1313
+ 2384,
1314
+ 2401,
1315
+ 2417,
1316
+ 2420,
1317
+ 2421,
1318
+ 2424,
1319
+ 2430,
1320
+ 2435,
1321
+ 2456,
1322
+ 2488,
1323
+ 2502,
1324
+ 2504,
1325
+ 2519,
1326
+ 2527,
1327
+ 2532,
1328
+ 2538,
1329
+ 2542,
1330
+ 2553,
1331
+ 2555,
1332
+ 2558,
1333
+ 2559,
1334
+ 2562,
1335
+ 2578,
1336
+ 2583,
1337
+ 2585,
1338
+ 2590,
1339
+ 2592,
1340
+ 2594,
1341
+ 2596,
1342
+ 2600,
1343
+ 2606,
1344
+ 2607,
1345
+ 2618,
1346
+ 2630,
1347
+ 2637,
1348
+ 2647,
1349
+ 2650,
1350
+ 2657,
1351
+ 2679,
1352
+ 2685,
1353
+ 2705,
1354
+ 2706,
1355
+ 2712,
1356
+ 2713,
1357
+ 2714,
1358
+ 2727,
1359
+ 2740,
1360
+ 2742,
1361
+ 2755,
1362
+ 2780,
1363
+ 2784,
1364
+ 2792,
1365
+ 2807,
1366
+ 2808,
1367
+ 2810,
1368
+ 2820,
1369
+ 2831,
1370
+ 2839,
1371
+ 2860,
1372
+ 2862,
1373
+ 2863,
1374
+ 2866,
1375
+ 2875,
1376
+ 2878,
1377
+ 2898,
1378
+ 2905,
1379
+ 2921,
1380
+ 2922,
1381
+ 2926,
1382
+ 2930,
1383
+ 2934,
1384
+ 2944,
1385
+ 2955,
1386
+ 2957,
1387
+ 2959,
1388
+ 2973,
1389
+ 2978,
1390
+ 2998,
1391
+ 3018,
1392
+ 3022,
1393
+ 3028,
1394
+ 3031,
1395
+ 3061,
1396
+ 3085,
1397
+ 3090,
1398
+ 3104,
1399
+ 3105,
1400
+ 3111,
1401
+ 3115,
1402
+ 3121,
1403
+ 3122,
1404
+ 3129,
1405
+ 3133,
1406
+ 3135,
1407
+ 3161,
1408
+ 3162,
1409
+ 3169,
1410
+ 3173,
1411
+ 3194,
1412
+ 3195,
1413
+ 3215,
1414
+ 3225,
1415
+ 3226,
1416
+ 3241,
1417
+ 3247,
1418
+ 3250,
1419
+ 3253,
1420
+ 3265,
1421
+ 3268,
1422
+ 3293,
1423
+ 3301,
1424
+ 3312,
1425
+ 3329,
1426
+ 3352,
1427
+ 3361,
1428
+ 3362,
1429
+ 3376,
1430
+ 3396,
1431
+ 3401,
1432
+ 3403,
1433
+ 3410,
1434
+ 3419,
1435
+ 3432,
1436
+ 3443,
1437
+ 3452,
1438
+ 3467,
1439
+ 3469,
1440
+ 3475,
1441
+ 3485,
1442
+ 3503,
1443
+ 3514,
1444
+ 3515,
1445
+ 3524,
1446
+ 3528,
1447
+ 3538,
1448
+ 3544,
1449
+ 3557,
1450
+ 3560,
1451
+ 3565,
1452
+ 3600,
1453
+ 3637,
1454
+ 3642,
1455
+ 3658,
1456
+ 3659,
1457
+ 3692,
1458
+ 3693,
1459
+ 3699,
1460
+ 3722,
1461
+ 3725,
1462
+ 3728,
1463
+ 3731,
1464
+ 3740,
1465
+ 3742,
1466
+ 3762,
1467
+ 3766,
1468
+ 3780,
1469
+ 3788,
1470
+ 3794,
1471
+ 3796,
1472
+ 3798,
1473
+ 3805,
1474
+ 3817,
1475
+ 3819,
1476
+ 3822,
1477
+ 3837,
1478
+ 3839,
1479
+ 3843,
1480
+ 3846,
1481
+ 3851,
1482
+ 3854,
1483
+ 3865,
1484
+ 3870,
1485
+ 3871,
1486
+ 3884,
1487
+ 3894,
1488
+ 3895,
1489
+ 3896,
1490
+ 3907,
1491
+ 3911,
1492
+ 3915,
1493
+ 3919,
1494
+ 3920,
1495
+ 3923,
1496
+ 3933,
1497
+ 3955,
1498
+ 3967,
1499
+ 3972,
1500
+ 3974,
1501
+ 3975,
1502
+ 3984,
1503
+ 3985,
1504
+ 3997,
1505
+ 4002,
1506
+ 4010,
1507
+ 4034,
1508
+ 4044,
1509
+ 4063,
1510
+ 4073,
1511
+ 4079,
1512
+ 4082,
1513
+ 4088,
1514
+ 4121,
1515
+ 4145,
1516
+ 4148,
1517
+ 4159,
1518
+ 4161,
1519
+ 4164,
1520
+ 4177,
1521
+ 4188,
1522
+ 4199,
1523
+ 4203,
1524
+ 4207,
1525
+ 4208,
1526
+ 4213,
1527
+ 4221,
1528
+ 4225,
1529
+ 4233,
1530
+ 4241,
1531
+ 4243,
1532
+ 4247,
1533
+ 4264,
1534
+ 4274,
1535
+ 4282,
1536
+ 4286,
1537
+ 4290,
1538
+ 4308,
1539
+ 4310,
1540
+ 4313,
1541
+ 4321,
1542
+ 4324,
1543
+ 4327,
1544
+ 4349,
1545
+ 4362,
1546
+ 4370,
1547
+ 4374,
1548
+ 4380,
1549
+ 4407,
1550
+ 4409,
1551
+ 4411,
1552
+ 4415,
1553
+ 4417,
1554
+ 4418,
1555
+ 4427,
1556
+ 4431,
1557
+ 4433,
1558
+ 4451,
1559
+ 4466,
1560
+ 4477,
1561
+ 4478,
1562
+ 4479,
1563
+ 4493,
1564
+ 4494,
1565
+ 4514,
1566
+ 4527,
1567
+ 4539,
1568
+ 4550,
1569
+ 4558,
1570
+ 4568,
1571
+ 4579,
1572
+ 4583,
1573
+ 4584,
1574
+ 4586,
1575
+ 4587,
1576
+ 4590,
1577
+ 4599,
1578
+ 4602,
1579
+ 4610,
1580
+ 4626,
1581
+ 4627,
1582
+ 4630,
1583
+ 4641,
1584
+ 4647,
1585
+ 4655,
1586
+ 4656,
1587
+ 4657,
1588
+ 4661,
1589
+ 4685,
1590
+ 4714,
1591
+ 4715,
1592
+ 4731,
1593
+ 4749,
1594
+ 4752,
1595
+ 4769,
1596
+ 4777,
1597
+ 4782,
1598
+ 4791,
1599
+ 4805,
1600
+ 4818,
1601
+ 4829,
1602
+ 4833,
1603
+ 4837,
1604
+ 4839,
1605
+ 4843,
1606
+ 4871,
1607
+ 4875,
1608
+ 4879,
1609
+ 4880,
1610
+ 4885,
1611
+ 4888,
1612
+ 4895,
1613
+ 4900,
1614
+ 4923,
1615
+ 4966,
1616
+ 4968,
1617
+ 4972,
1618
+ 4989,
1619
+ 4994,
1620
+ 4998,
1621
+ 5001,
1622
+ 5013,
1623
+ 5019,
1624
+ 5026,
1625
+ 5032,
1626
+ 5034,
1627
+ 5046,
1628
+ 5055,
1629
+ 5085,
1630
+ 5086,
1631
+ 5088,
1632
+ 5089,
1633
+ 5090,
1634
+ 5095,
1635
+ 5108,
1636
+ 5110,
1637
+ 5119,
1638
+ 5120,
1639
+ 5121,
1640
+ 5133,
1641
+ 5148,
1642
+ 5154,
1643
+ 5160,
1644
+ 5169,
1645
+ 5178,
1646
+ 5222,
1647
+ 5223,
1648
+ 5232,
1649
+ 5233,
1650
+ 5240,
1651
+ 5256,
1652
+ 5259,
1653
+ 5264,
1654
+ 5271,
1655
+ 5276,
1656
+ 5279,
1657
+ 5294,
1658
+ 5300,
1659
+ 5303,
1660
+ 5321,
1661
+ 5335,
1662
+ 5337,
1663
+ 5345,
1664
+ 5348,
1665
+ 5365,
1666
+ 5373,
1667
+ 5378,
1668
+ 5384,
1669
+ 5422,
1670
+ 5442,
1671
+ 5443,
1672
+ 5445,
1673
+ 5477,
1674
+ 5485,
1675
+ 5495,
1676
+ 5497,
1677
+ 5504,
1678
+ 5526,
1679
+ 5533,
1680
+ 5542,
1681
+ 5564,
1682
+ 5570,
1683
+ 5579,
1684
+ 5587,
1685
+ 5592,
1686
+ 5608,
1687
+ 5610,
1688
+ 5624,
1689
+ 5630,
1690
+ 5638,
1691
+ 5651,
1692
+ 5663,
1693
+ 5670,
1694
+ 5675,
1695
+ 5691,
1696
+ 5700,
1697
+ 5706,
1698
+ 5707,
1699
+ 5715,
1700
+ 5720,
1701
+ 5721,
1702
+ 5722,
1703
+ 5732,
1704
+ 5738,
1705
+ 5741,
1706
+ 5769,
1707
+ 5771,
1708
+ 5775,
1709
+ 5795,
1710
+ 5796,
1711
+ 5800,
1712
+ 5809,
1713
+ 5810,
1714
+ 5815,
1715
+ 5819,
1716
+ 5827,
1717
+ 5848,
1718
+ 5849,
1719
+ 5852,
1720
+ 5859,
1721
+ 5880,
1722
+ 5884,
1723
+ 5907,
1724
+ 5909,
1725
+ 5912,
1726
+ 5919,
1727
+ 5931,
1728
+ 5932,
1729
+ 5934,
1730
+ 5941,
1731
+ 5948,
1732
+ 5950,
1733
+ 5952,
1734
+ 5953,
1735
+ 5969,
1736
+ 5981,
1737
+ 6000,
1738
+ 6003,
1739
+ 6010,
1740
+ 6018,
1741
+ 6041,
1742
+ 6065,
1743
+ 6075,
1744
+ 6090,
1745
+ 6103,
1746
+ 6106,
1747
+ 6109,
1748
+ 6114,
1749
+ 6123,
1750
+ 6131,
1751
+ 6136,
1752
+ 6138,
1753
+ 6139,
1754
+ 6164,
1755
+ 6165,
1756
+ 6171,
1757
+ 6173,
1758
+ 6180,
1759
+ 6185,
1760
+ 6189,
1761
+ 6190,
1762
+ 6221,
1763
+ 6223,
1764
+ 6237,
1765
+ 6255,
1766
+ 6262,
1767
+ 6265,
1768
+ 6293,
1769
+ 6296,
1770
+ 6305,
1771
+ 6318,
1772
+ 6331,
1773
+ 6336,
1774
+ 6340,
1775
+ 6355,
1776
+ 6366,
1777
+ 6371,
1778
+ 6396,
1779
+ 6399,
1780
+ 6402,
1781
+ 6408,
1782
+ 6432,
1783
+ 6433,
1784
+ 6441,
1785
+ 6456,
1786
+ 6465,
1787
+ 6478,
1788
+ 6486,
1789
+ 6489,
1790
+ 6507,
1791
+ 6508,
1792
+ 6520,
1793
+ 6522,
1794
+ 6528,
1795
+ 6537,
1796
+ 6551,
1797
+ 6564,
1798
+ 6589,
1799
+ 6590,
1800
+ 6598,
1801
+ 6599,
1802
+ 6611,
1803
+ 6613,
1804
+ 6615,
1805
+ 6621,
1806
+ 6634,
1807
+ 6647,
1808
+ 6649,
1809
+ 6654,
1810
+ 6676,
1811
+ 6680,
1812
+ 6690,
1813
+ 6708,
1814
+ 6729,
1815
+ 6736,
1816
+ 6744,
1817
+ 6749,
1818
+ 6756,
1819
+ 6761,
1820
+ 6763,
1821
+ 6773,
1822
+ 6788,
1823
+ 6790,
1824
+ 6796,
1825
+ 6797,
1826
+ 6811,
1827
+ 6824,
1828
+ 6850,
1829
+ 6869,
1830
+ 6871,
1831
+ 6882,
1832
+ 6892,
1833
+ 6895,
1834
+ 6906,
1835
+ 6911,
1836
+ 6912,
1837
+ 6914,
1838
+ 6927,
1839
+ 6952,
1840
+ 6966,
1841
+ 6985,
1842
+ 7001,
1843
+ 7021,
1844
+ 7031,
1845
+ 7035,
1846
+ 7038,
1847
+ 7041,
1848
+ 7045,
1849
+ 7052,
1850
+ 7057,
1851
+ 7058,
1852
+ 7072,
1853
+ 7073,
1854
+ 7076,
1855
+ 7086,
1856
+ 7102,
1857
+ 7107,
1858
+ 7109,
1859
+ 7117,
1860
+ 7122,
1861
+ 7125,
1862
+ 7166,
1863
+ 7182,
1864
+ 7199,
1865
+ 7207,
1866
+ 7212,
1867
+ 7215,
1868
+ 7232,
1869
+ 7243,
1870
+ 7246,
1871
+ 7250,
1872
+ 7253,
1873
+ 7258,
1874
+ 7263,
1875
+ 7267,
1876
+ 7270,
1877
+ 7274,
1878
+ 7280,
1879
+ 7286,
1880
+ 7293,
1881
+ 7298,
1882
+ 7302,
1883
+ 7306,
1884
+ 7316,
1885
+ 7325,
1886
+ 7326,
1887
+ 7334,
1888
+ 7356,
1889
+ 7357,
1890
+ 7363,
1891
+ 7364,
1892
+ 7367,
1893
+ 7385,
1894
+ 7392,
1895
+ 7399,
1896
+ 7405,
1897
+ 7416,
1898
+ 7420,
1899
+ 7421,
1900
+ 7426,
1901
+ 7452,
1902
+ 7476,
1903
+ 7481,
1904
+ 7519,
1905
+ 7534,
1906
+ 7542,
1907
+ 7546,
1908
+ 7573,
1909
+ 7585,
1910
+ 7601,
1911
+ 7604,
1912
+ 7606,
1913
+ 7609,
1914
+ 7629,
1915
+ 7649,
1916
+ 7653,
1917
+ 7667,
1918
+ 7682,
1919
+ 7699,
1920
+ 7738,
1921
+ 7750,
1922
+ 7786,
1923
+ 7798,
1924
+ 7800,
1925
+ 7801,
1926
+ 7805,
1927
+ 7806,
1928
+ 7811,
1929
+ 7813,
1930
+ 7832,
1931
+ 7837,
1932
+ 7849,
1933
+ 7856,
1934
+ 7876,
1935
+ 7877,
1936
+ 7887,
1937
+ 7905,
1938
+ 7916,
1939
+ 7919,
1940
+ 7920,
1941
+ 7922,
1942
+ 7923,
1943
+ 7926,
1944
+ 7944,
1945
+ 7961,
1946
+ 7966,
1947
+ 7970,
1948
+ 7973,
1949
+ 7974,
1950
+ 7976,
1951
+ 7986,
1952
+ 7999,
1953
+ 8027,
1954
+ 8028,
1955
+ 8034,
1956
+ 8047,
1957
+ 8068,
1958
+ 8074,
1959
+ 8077,
1960
+ 8091,
1961
+ 8120,
1962
+ 8122,
1963
+ 8125,
1964
+ 8152,
1965
+ 8153,
1966
+ 8164,
1967
+ 8167,
1968
+ 8169,
1969
+ 8171,
1970
+ 8177,
1971
+ 8184,
1972
+ 8189,
1973
+ 8192,
1974
+ 8196,
1975
+ 8202,
1976
+ 8212,
1977
+ 8217,
1978
+ 8231,
1979
+ 8242,
1980
+ 8244,
1981
+ 8250,
1982
+ 8256,
1983
+ 8257,
1984
+ 8265,
1985
+ 8270,
1986
+ 8274,
1987
+ 8283,
1988
+ 8290,
1989
+ 8294,
1990
+ 8301,
1991
+ 8302,
1992
+ 8307,
1993
+ 8318,
1994
+ 8326,
1995
+ 8338,
1996
+ 8349,
1997
+ 8350,
1998
+ 8353,
1999
+ 8357,
2000
+ 8371,
2001
+ 8374,
2002
+ 8377,
2003
+ 8380,
2004
+ 8387,
2005
+ 8388,
2006
+ 8396,
2007
+ 8402,
2008
+ 8419,
2009
+ 8423,
2010
+ 8428,
2011
+ 8435,
2012
+ 8439,
2013
+ 8442,
2014
+ 8444,
2015
+ 8453,
2016
+ 8461,
2017
+ 8475,
2018
+ 8481,
2019
+ 8485,
2020
+ 8493,
2021
+ 8495,
2022
+ 8498,
2023
+ 8523,
2024
+ 8530,
2025
+ 8531,
2026
+ 8562
2027
+ ],
2028
+ "early_stopping_patience": 3
2029
+ }
phase1/ablations/matched_clean/README.md ADDED
@@ -0,0 +1,80 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: peft
3
+ model_name: phase1-qwen-matched-clean-ablation
4
+ tags:
5
+ - base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct
6
+ - dpo
7
+ - lora
8
+ - transformers
9
+ - trl
10
+ license: apache-2.0
11
+ base_model: Qwen/Qwen2.5-1.5B-Instruct
12
+ pipeline_tag: text-generation
13
+ ---
14
+
15
+ # Phase 1 Qwen `matched_clean` diagnostic ablation
16
+
17
+ This is the Phase 1 `matched_clean` diagnostic LoRA-DPO adapter fine-tuned from
18
+ [Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct).
19
+ The frozen training recipe and membership hashes are included in this directory.
20
+
21
+ ## Quick start
22
+
23
+ ```python
24
+ from peft import PeftModel
25
+ from transformers import AutoModelForCausalLM, AutoTokenizer
26
+
27
+ repo_id = "geyuxu/york-milestone-project-self-traing-loop-model"
28
+ subfolder = "phase1/ablations/matched_clean"
29
+ base_id = "Qwen/Qwen2.5-1.5B-Instruct"
30
+
31
+ tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder)
32
+ base_model = AutoModelForCausalLM.from_pretrained(
33
+ base_id, torch_dtype="auto", device_map="auto"
34
+ )
35
+ model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder)
36
+ ```
37
+
38
+ ## Training procedure
39
+
40
+
41
+
42
+
43
+
44
+ This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290).
45
+
46
+ ### Framework versions
47
+
48
+ - PEFT 0.18.1
49
+ - TRL: 0.29.0
50
+ - Transformers: 5.3.0
51
+ - Pytorch: 2.10.0
52
+ - Datasets: 4.6.1
53
+ - Tokenizers: 0.22.2
54
+
55
+ ## Citations
56
+
57
+ Cite DPO as:
58
+
59
+ ```bibtex
60
+ @inproceedings{rafailov2023direct,
61
+ title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}},
62
+ author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn},
63
+ year = 2023,
64
+ booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023},
65
+ url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html},
66
+ editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine},
67
+ }
68
+ ```
69
+
70
+ Cite TRL as:
71
+
72
+ ```bibtex
73
+ @software{vonwerra2020trl,
74
+ title = {{TRL: Transformers Reinforcement Learning}},
75
+ author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin},
76
+ license = {Apache-2.0},
77
+ url = {https://github.com/huggingface/trl},
78
+ year = {2020}
79
+ }
80
+ ```
phase1/ablations/matched_clean/adapter_config.json ADDED
@@ -0,0 +1,43 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 32,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "megatron_config": null,
23
+ "megatron_core": "megatron.core",
24
+ "modules_to_save": null,
25
+ "peft_type": "LORA",
26
+ "peft_version": "0.18.1",
27
+ "qalora_group_size": 16,
28
+ "r": 16,
29
+ "rank_pattern": {},
30
+ "revision": null,
31
+ "target_modules": [
32
+ "v_proj",
33
+ "k_proj",
34
+ "o_proj",
35
+ "q_proj"
36
+ ],
37
+ "target_parameters": null,
38
+ "task_type": "CAUSAL_LM",
39
+ "trainable_token_indices": null,
40
+ "use_dora": false,
41
+ "use_qalora": false,
42
+ "use_rslora": false
43
+ }
phase1/ablations/matched_clean/adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:724b1e847a25563f7fe04d27dfa05df9213b97348490c4cf5b8f1c0cbdb90b68
3
+ size 17462432
phase1/ablations/matched_clean/chat_template.jinja ADDED
@@ -0,0 +1,54 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0]['role'] == 'system' %}
4
+ {{- messages[0]['content'] }}
5
+ {%- else %}
6
+ {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }}
7
+ {%- endif %}
8
+ {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
9
+ {%- for tool in tools %}
10
+ {{- "\n" }}
11
+ {{- tool | tojson }}
12
+ {%- endfor %}
13
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
14
+ {%- else %}
15
+ {%- if messages[0]['role'] == 'system' %}
16
+ {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }}
17
+ {%- else %}
18
+ {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }}
19
+ {%- endif %}
20
+ {%- endif %}
21
+ {%- for message in messages %}
22
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %}
23
+ {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
24
+ {%- elif message.role == "assistant" %}
25
+ {{- '<|im_start|>' + message.role }}
26
+ {%- if message.content %}
27
+ {{- '\n' + message.content }}
28
+ {%- endif %}
29
+ {%- for tool_call in message.tool_calls %}
30
+ {%- if tool_call.function is defined %}
31
+ {%- set tool_call = tool_call.function %}
32
+ {%- endif %}
33
+ {{- '\n<tool_call>\n{"name": "' }}
34
+ {{- tool_call.name }}
35
+ {{- '", "arguments": ' }}
36
+ {{- tool_call.arguments | tojson }}
37
+ {{- '}\n</tool_call>' }}
38
+ {%- endfor %}
39
+ {{- '<|im_end|>\n' }}
40
+ {%- elif message.role == "tool" %}
41
+ {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %}
42
+ {{- '<|im_start|>user' }}
43
+ {%- endif %}
44
+ {{- '\n<tool_response>\n' }}
45
+ {{- message.content }}
46
+ {{- '\n</tool_response>' }}
47
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
48
+ {{- '<|im_end|>\n' }}
49
+ {%- endif %}
50
+ {%- endif %}
51
+ {%- endfor %}
52
+ {%- if add_generation_prompt %}
53
+ {{- '<|im_start|>assistant\n' }}
54
+ {%- endif %}
phase1/ablations/matched_clean/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5
3
+ size 11422166
phase1/ablations/matched_clean/tokenizer_config.json ADDED
@@ -0,0 +1,29 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": null,
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|im_start|>",
10
+ "<|im_end|>",
11
+ "<|object_ref_start|>",
12
+ "<|object_ref_end|>",
13
+ "<|box_start|>",
14
+ "<|box_end|>",
15
+ "<|quad_start|>",
16
+ "<|quad_end|>",
17
+ "<|vision_start|>",
18
+ "<|vision_end|>",
19
+ "<|vision_pad|>",
20
+ "<|image_pad|>",
21
+ "<|video_pad|>"
22
+ ],
23
+ "is_local": true,
24
+ "model_max_length": 131072,
25
+ "pad_token": "<|endoftext|>",
26
+ "split_special_tokens": false,
27
+ "tokenizer_class": "Qwen2Tokenizer",
28
+ "unk_token": null
29
+ }
phase1/ablations/matched_clean/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cfafc3f2a531cdc31948a992577839650613ac2f09616d9263508e3e97da8555
3
+ size 5841
phase1/ablations/matched_clean/training_recipe.json ADDED
@@ -0,0 +1,22 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "format_version": 1,
3
+ "experiment": "confusion_ablation",
4
+ "ablation": "matched_clean",
5
+ "model_name": "Qwen/Qwen2.5-1.5B-Instruct",
6
+ "train_membership_sha256": "b497fa765223a9810ad784f31e1598edfa992a162146d6f94d9cdf4adcedd87d",
7
+ "validation_membership_sha256": "2f609467438cd6a01fd84b9d80c0fcd84c44767e3b2ed98f4f6a83d68a62c181",
8
+ "num_train_pairs": 77124,
9
+ "num_validation_pairs": 8563,
10
+ "transformation_seed": 22,
11
+ "validation_prompt_mode": "clean_rag",
12
+ "learning_rate": 1e-05,
13
+ "beta": 0.1,
14
+ "num_epochs": 1.0,
15
+ "seed": 22,
16
+ "max_length": 512,
17
+ "max_prompt_length": 384,
18
+ "gradient_accumulation_steps": 80,
19
+ "save_steps": 125,
20
+ "save_total_limit": 12,
21
+ "preference_pairs_format_version": 2
22
+ }
phase1/ablations/matched_clean/training_summary.json ADDED
@@ -0,0 +1,2925 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_name": "Qwen/Qwen2.5-1.5B-Instruct",
3
+ "resolved_model": "Qwen/Qwen2.5-1.5B-Instruct",
4
+ "num_train_records": 77124,
5
+ "num_validation_records_available": 8563,
6
+ "training_config": {
7
+ "lora_rank": 16,
8
+ "lora_alpha": 32,
9
+ "learning_rate": 1e-05,
10
+ "num_epochs": 1.0,
11
+ "per_device_batch_size": 1,
12
+ "per_device_eval_batch_size": 1,
13
+ "gradient_accumulation_steps": 80,
14
+ "beta": 0.1,
15
+ "max_length": 512,
16
+ "max_prompt_length": 384,
17
+ "seed": 22,
18
+ "save_steps": 125,
19
+ "save_total_limit": 12,
20
+ "resume_from_checkpoint": null,
21
+ "precision_dtype": "torch.bfloat16",
22
+ "bf16": true,
23
+ "fp16": false,
24
+ "tokenizer_add_bos_token": false
25
+ },
26
+ "global_step": 965,
27
+ "best_metric": 0.4090946316719055,
28
+ "best_model_checkpoint": "outputs/confusion_ablation_phase1_repair_v3/matched_clean/lora/checkpoint-875",
29
+ "train_metrics": {
30
+ "train_runtime": 36967.0361,
31
+ "train_samples_per_second": 2.086,
32
+ "train_steps_per_second": 0.026,
33
+ "total_flos": 5.2405488888805786e+17,
34
+ "train_loss": 0.453640728787437
35
+ },
36
+ "log_history": [
37
+ {
38
+ "loss": 0.6900316715240479,
39
+ "grad_norm": 0.011662614531815052,
40
+ "learning_rate": 9.906735751295338e-06,
41
+ "entropy": 0.8081745196832344,
42
+ "num_tokens": 669528.0,
43
+ "logits/chosen": -0.9878667544984245,
44
+ "logits/rejected": -0.8929429136538265,
45
+ "mean_token_accuracy": 0.7366863564029336,
46
+ "rewards/chosen": 0.0014809935365531145,
47
+ "rewards/rejected": -0.0051326466447972055,
48
+ "rewards/accuracies": 0.495,
49
+ "rewards/margins": 0.00661364022129419,
50
+ "logps/chosen": -48.20964523553848,
51
+ "logps/rejected": -54.25052870512009,
52
+ "epoch": 0.010372905969607386,
53
+ "step": 10
54
+ },
55
+ {
56
+ "loss": 0.6709239482879639,
57
+ "grad_norm": 0.01787947677075863,
58
+ "learning_rate": 9.803108808290156e-06,
59
+ "entropy": 0.7905870282277465,
60
+ "num_tokens": 1338759.0,
61
+ "logits/chosen": -0.9877784900726513,
62
+ "logits/rejected": -0.9284377500817239,
63
+ "mean_token_accuracy": 0.7397855435311794,
64
+ "rewards/chosen": -0.016295835754335714,
65
+ "rewards/rejected": -0.06304080443188653,
66
+ "rewards/accuracies": 0.74,
67
+ "rewards/margins": 0.046744968572747896,
68
+ "logps/chosen": -49.98522471666336,
69
+ "logps/rejected": -53.08380969285965,
70
+ "epoch": 0.02074581193921477,
71
+ "step": 20
72
+ },
73
+ {
74
+ "loss": 0.6449037075042725,
75
+ "grad_norm": 0.012443667277693748,
76
+ "learning_rate": 9.699481865284975e-06,
77
+ "entropy": 0.8007427603192627,
78
+ "num_tokens": 2009918.0,
79
+ "logits/chosen": -1.0123033629117577,
80
+ "logits/rejected": -0.9116259647175791,
81
+ "mean_token_accuracy": 0.7288216127734631,
82
+ "rewards/chosen": -0.08125005806276021,
83
+ "rewards/rejected": -0.18847612114805087,
84
+ "rewards/accuracies": 0.7525,
85
+ "rewards/margins": 0.10722606290772091,
86
+ "logps/chosen": -51.017456583976745,
87
+ "logps/rejected": -55.82100034952164,
88
+ "epoch": 0.031118717908822157,
89
+ "step": 30
90
+ },
91
+ {
92
+ "loss": 0.6104300498962403,
93
+ "grad_norm": 0.011565622873604298,
94
+ "learning_rate": 9.595854922279793e-06,
95
+ "entropy": 0.7688610723486636,
96
+ "num_tokens": 2680367.0,
97
+ "logits/chosen": -1.0477489025836138,
98
+ "logits/rejected": -0.9185756571968596,
99
+ "mean_token_accuracy": 0.7304606804065407,
100
+ "rewards/chosen": -0.18015499103314597,
101
+ "rewards/rejected": -0.377999417107676,
102
+ "rewards/accuracies": 0.76125,
103
+ "rewards/margins": 0.19784442565287463,
104
+ "logps/chosen": -52.41810529708862,
105
+ "logps/rejected": -56.31561070203781,
106
+ "epoch": 0.04149162387842954,
107
+ "step": 40
108
+ },
109
+ {
110
+ "loss": 0.5890812397003173,
111
+ "grad_norm": 0.011881239712238312,
112
+ "learning_rate": 9.492227979274612e-06,
113
+ "entropy": 0.767548923434224,
114
+ "num_tokens": 3350695.0,
115
+ "logits/chosen": -1.045900867553522,
116
+ "logits/rejected": -0.8987545206323213,
117
+ "mean_token_accuracy": 0.7290248272754252,
118
+ "rewards/chosen": -0.3571337752114414,
119
+ "rewards/rejected": -0.635303623637883,
120
+ "rewards/accuracies": 0.76125,
121
+ "rewards/margins": 0.27816984807141126,
122
+ "logps/chosen": -53.70132049441337,
123
+ "logps/rejected": -58.7293958568573,
124
+ "epoch": 0.051864529848036925,
125
+ "step": 50
126
+ },
127
+ {
128
+ "loss": 0.5672520160675049,
129
+ "grad_norm": 0.012122954241931438,
130
+ "learning_rate": 9.388601036269432e-06,
131
+ "entropy": 0.7509493381145876,
132
+ "num_tokens": 4019867.0,
133
+ "logits/chosen": -1.0931640275508827,
134
+ "logits/rejected": -0.9542402869856921,
135
+ "mean_token_accuracy": 0.7216887871176004,
136
+ "rewards/chosen": -0.5263037721261935,
137
+ "rewards/rejected": -0.9088172687360202,
138
+ "rewards/accuracies": 0.74875,
139
+ "rewards/margins": 0.38251349702011794,
140
+ "logps/chosen": -54.063412301540374,
141
+ "logps/rejected": -60.20355456352234,
142
+ "epoch": 0.062237435817644314,
143
+ "step": 60
144
+ },
145
+ {
146
+ "loss": 0.5313051700592041,
147
+ "grad_norm": 0.012870470061898232,
148
+ "learning_rate": 9.284974093264249e-06,
149
+ "entropy": 0.7521841926735943,
150
+ "num_tokens": 4689830.0,
151
+ "logits/chosen": -1.1636649836163147,
152
+ "logits/rejected": -0.9546643791863164,
153
+ "mean_token_accuracy": 0.7130510857887566,
154
+ "rewards/chosen": -0.7180539178028266,
155
+ "rewards/rejected": -1.2522271308361086,
156
+ "rewards/accuracies": 0.765,
157
+ "rewards/margins": 0.5341732117999345,
158
+ "logps/chosen": -57.92338786125183,
159
+ "logps/rejected": -64.00875183820725,
160
+ "epoch": 0.0726103417872517,
161
+ "step": 70
162
+ },
163
+ {
164
+ "loss": 0.524173355102539,
165
+ "grad_norm": 0.012850801460444927,
166
+ "learning_rate": 9.181347150259067e-06,
167
+ "entropy": 0.7584943031892181,
168
+ "num_tokens": 5359790.0,
169
+ "logits/chosen": -1.257342141058688,
170
+ "logits/rejected": -1.0016241015611054,
171
+ "mean_token_accuracy": 0.7126817052811384,
172
+ "rewards/chosen": -0.9431407463727374,
173
+ "rewards/rejected": -1.5808365274948302,
174
+ "rewards/accuracies": 0.76375,
175
+ "rewards/margins": 0.6376957796374336,
176
+ "logps/chosen": -58.12816961526871,
177
+ "logps/rejected": -69.45178006649017,
178
+ "epoch": 0.08298324775685909,
179
+ "step": 80
180
+ },
181
+ {
182
+ "loss": 0.5096397399902344,
183
+ "grad_norm": 0.015030446462333202,
184
+ "learning_rate": 9.077720207253888e-06,
185
+ "entropy": 0.7446463107218733,
186
+ "num_tokens": 6029642.0,
187
+ "logits/chosen": -1.3131360929541611,
188
+ "logits/rejected": -1.12108701233509,
189
+ "mean_token_accuracy": 0.6976540317758918,
190
+ "rewards/chosen": -1.0887427906056837,
191
+ "rewards/rejected": -1.8297204279349535,
192
+ "rewards/accuracies": 0.765,
193
+ "rewards/margins": 0.7409776375815272,
194
+ "logps/chosen": -62.075138006210324,
195
+ "logps/rejected": -71.068751745224,
196
+ "epoch": 0.09335615372646647,
197
+ "step": 90
198
+ },
199
+ {
200
+ "loss": 0.5227419376373291,
201
+ "grad_norm": 0.017649168148636818,
202
+ "learning_rate": 8.974093264248706e-06,
203
+ "entropy": 0.774682844899653,
204
+ "num_tokens": 6703750.0,
205
+ "logits/chosen": -1.3070892244508543,
206
+ "logits/rejected": -1.0911262790664193,
207
+ "mean_token_accuracy": 0.698255299879238,
208
+ "rewards/chosen": -1.2929798694234342,
209
+ "rewards/rejected": -2.059200689474819,
210
+ "rewards/accuracies": 0.755,
211
+ "rewards/margins": 0.7662208179756999,
212
+ "logps/chosen": -67.27675194501877,
213
+ "logps/rejected": -78.23825345277787,
214
+ "epoch": 0.10372905969607385,
215
+ "step": 100
216
+ },
217
+ {
218
+ "loss": 0.5076948642730713,
219
+ "grad_norm": 0.018913043662905693,
220
+ "learning_rate": 8.870466321243523e-06,
221
+ "entropy": 0.723871832547884,
222
+ "num_tokens": 7374932.0,
223
+ "logits/chosen": -1.3768008463722332,
224
+ "logits/rejected": -1.1314466745219074,
225
+ "mean_token_accuracy": 0.7054882103763521,
226
+ "rewards/chosen": -1.247365918380383,
227
+ "rewards/rejected": -2.083569277639035,
228
+ "rewards/accuracies": 0.775,
229
+ "rewards/margins": 0.8362033596914261,
230
+ "logps/chosen": -62.56643625497818,
231
+ "logps/rejected": -73.74503843307495,
232
+ "epoch": 0.11410196566568125,
233
+ "step": 110
234
+ },
235
+ {
236
+ "loss": 0.518116807937622,
237
+ "grad_norm": 0.014157967641949654,
238
+ "learning_rate": 8.766839378238343e-06,
239
+ "entropy": 0.7146987286728108,
240
+ "num_tokens": 8045025.0,
241
+ "logits/chosen": -1.392513233808292,
242
+ "logits/rejected": -1.167585582525032,
243
+ "mean_token_accuracy": 0.7107785574346781,
244
+ "rewards/chosen": -1.1991379019781017,
245
+ "rewards/rejected": -1.9976002290286123,
246
+ "rewards/accuracies": 0.76625,
247
+ "rewards/margins": 0.7984623239561915,
248
+ "logps/chosen": -63.023617169857026,
249
+ "logps/rejected": -70.3282685637474,
250
+ "epoch": 0.12447487163528863,
251
+ "step": 120
252
+ },
253
+ {
254
+ "eval_loss": 0.49094030261039734,
255
+ "eval_runtime": 195.9122,
256
+ "eval_samples_per_second": 5.104,
257
+ "eval_steps_per_second": 5.104,
258
+ "eval_entropy": 0.7422072718068957,
259
+ "eval_num_tokens": 8380297.0,
260
+ "eval_logits/chosen": -1.3606685028205767,
261
+ "eval_logits/rejected": -1.1272819430340941,
262
+ "eval_mean_token_accuracy": 0.7042824859470129,
263
+ "eval_rewards/chosen": -1.0899753504878027,
264
+ "eval_rewards/rejected": -1.9470994755723514,
265
+ "eval_rewards/accuracies": 0.777,
266
+ "eval_rewards/margins": 0.8571241236105561,
267
+ "eval_logps/chosen": -61.07274015617371,
268
+ "eval_logps/rejected": -72.11086616706848,
269
+ "epoch": 0.1296613246200923,
270
+ "step": 125
271
+ },
272
+ {
273
+ "loss": 0.4915438652038574,
274
+ "grad_norm": 0.014024928212165833,
275
+ "learning_rate": 8.663212435233162e-06,
276
+ "entropy": 0.7629431400250177,
277
+ "num_tokens": 8716283.0,
278
+ "logits/chosen": -1.3493070406504677,
279
+ "logits/rejected": -1.1303618494014056,
280
+ "mean_token_accuracy": 0.7068962034024299,
281
+ "rewards/chosen": -1.064063529693958,
282
+ "rewards/rejected": -1.9368204824090935,
283
+ "rewards/accuracies": 0.7825,
284
+ "rewards/margins": 0.8727569509390741,
285
+ "logps/chosen": -61.36201237678528,
286
+ "logps/rejected": -73.24028332233429,
287
+ "epoch": 0.13484777760489602,
288
+ "step": 130
289
+ },
290
+ {
291
+ "loss": 0.5040828704833984,
292
+ "grad_norm": 0.01371421106159687,
293
+ "learning_rate": 8.55958549222798e-06,
294
+ "entropy": 0.7165489907818846,
295
+ "num_tokens": 9385323.0,
296
+ "logits/chosen": -1.4613930482520017,
297
+ "logits/rejected": -1.211856862455939,
298
+ "mean_token_accuracy": 0.7094380159396678,
299
+ "rewards/chosen": -1.0889925239968579,
300
+ "rewards/rejected": -1.8759657187038101,
301
+ "rewards/accuracies": 0.77875,
302
+ "rewards/margins": 0.7869731936138123,
303
+ "logps/chosen": -57.32686332225799,
304
+ "logps/rejected": -71.04226065397262,
305
+ "epoch": 0.1452206835745034,
306
+ "step": 140
307
+ },
308
+ {
309
+ "loss": 0.45884413719177247,
310
+ "grad_norm": 0.01413357350975275,
311
+ "learning_rate": 8.455958549222799e-06,
312
+ "entropy": 0.701725748301833,
313
+ "num_tokens": 10057097.0,
314
+ "logits/chosen": -1.5608966569387421,
315
+ "logits/rejected": -1.247274744986142,
316
+ "mean_token_accuracy": 0.7153122393228114,
317
+ "rewards/chosen": -1.071364169051376,
318
+ "rewards/rejected": -2.1302177897136425,
319
+ "rewards/accuracies": 0.8075,
320
+ "rewards/margins": 1.0588536195317284,
321
+ "logps/chosen": -58.66886381149292,
322
+ "logps/rejected": -75.77571431159973,
323
+ "epoch": 0.1555935895441108,
324
+ "step": 150
325
+ },
326
+ {
327
+ "loss": 0.5141475677490235,
328
+ "grad_norm": 0.01554640382528305,
329
+ "learning_rate": 8.352331606217617e-06,
330
+ "entropy": 0.7456542236352106,
331
+ "num_tokens": 10728653.0,
332
+ "logits/chosen": -1.4681753702348763,
333
+ "logits/rejected": -1.2457289726855978,
334
+ "mean_token_accuracy": 0.70392991816625,
335
+ "rewards/chosen": -1.161004657074118,
336
+ "rewards/rejected": -2.000340641771909,
337
+ "rewards/accuracies": 0.77375,
338
+ "rewards/margins": 0.8393359830789268,
339
+ "logps/chosen": -64.61760116338729,
340
+ "logps/rejected": -74.73108973264694,
341
+ "epoch": 0.16596649551371817,
342
+ "step": 160
343
+ },
344
+ {
345
+ "loss": 0.48798179626464844,
346
+ "grad_norm": 0.013569124042987823,
347
+ "learning_rate": 8.248704663212436e-06,
348
+ "entropy": 0.7485733293113299,
349
+ "num_tokens": 11400551.0,
350
+ "logits/chosen": -1.469850987453924,
351
+ "logits/rejected": -1.2418553626350932,
352
+ "mean_token_accuracy": 0.7040991749428213,
353
+ "rewards/chosen": -1.1290287345201069,
354
+ "rewards/rejected": -2.089886896072421,
355
+ "rewards/accuracies": 0.775,
356
+ "rewards/margins": 0.9608581608976238,
357
+ "logps/chosen": -63.84155872344971,
358
+ "logps/rejected": -74.28893199920654,
359
+ "epoch": 0.17633940148332555,
360
+ "step": 170
361
+ },
362
+ {
363
+ "loss": 0.4588949203491211,
364
+ "grad_norm": 0.013312213122844696,
365
+ "learning_rate": 8.145077720207254e-06,
366
+ "entropy": 0.7363077022106154,
367
+ "num_tokens": 12070305.0,
368
+ "logits/chosen": -1.5014831557472343,
369
+ "logits/rejected": -1.253561978212398,
370
+ "mean_token_accuracy": 0.709209191892296,
371
+ "rewards/chosen": -1.082961096275685,
372
+ "rewards/rejected": -2.0920695228746626,
373
+ "rewards/accuracies": 0.80375,
374
+ "rewards/margins": 1.009108423003927,
375
+ "logps/chosen": -60.205562086105346,
376
+ "logps/rejected": -73.08745456457137,
377
+ "epoch": 0.18671230745293294,
378
+ "step": 180
379
+ },
380
+ {
381
+ "loss": 0.44720139503479006,
382
+ "grad_norm": 0.019025955349206924,
383
+ "learning_rate": 8.041450777202073e-06,
384
+ "entropy": 0.7329158629218,
385
+ "num_tokens": 12738966.0,
386
+ "logits/chosen": -1.6102334910947507,
387
+ "logits/rejected": -1.2938961518114829,
388
+ "mean_token_accuracy": 0.7022849645651877,
389
+ "rewards/chosen": -1.096955630929151,
390
+ "rewards/rejected": -2.191100225120317,
391
+ "rewards/accuracies": 0.80375,
392
+ "rewards/margins": 1.0941445926297455,
393
+ "logps/chosen": -62.84091185808182,
394
+ "logps/rejected": -73.56753115415573,
395
+ "epoch": 0.19708521342254032,
396
+ "step": 190
397
+ },
398
+ {
399
+ "loss": 0.5053049564361572,
400
+ "grad_norm": 0.022256096825003624,
401
+ "learning_rate": 7.937823834196891e-06,
402
+ "entropy": 0.7230936869091238,
403
+ "num_tokens": 13408002.0,
404
+ "logits/chosen": -1.6278242340657059,
405
+ "logits/rejected": -1.3487957538640436,
406
+ "mean_token_accuracy": 0.7035108367726207,
407
+ "rewards/chosen": -1.2608012669734308,
408
+ "rewards/rejected": -2.296834750812268,
409
+ "rewards/accuracies": 0.7525,
410
+ "rewards/margins": 1.036033486686647,
411
+ "logps/chosen": -61.396967930793764,
412
+ "logps/rejected": -75.2872954583168,
413
+ "epoch": 0.2074581193921477,
414
+ "step": 200
415
+ },
416
+ {
417
+ "loss": 0.4660433292388916,
418
+ "grad_norm": 0.014599275775253773,
419
+ "learning_rate": 7.834196891191712e-06,
420
+ "entropy": 0.6921609364774486,
421
+ "num_tokens": 14074115.0,
422
+ "logits/chosen": -1.7416979060664273,
423
+ "logits/rejected": -1.418815718305467,
424
+ "mean_token_accuracy": 0.7174021677859127,
425
+ "rewards/chosen": -1.077466004992384,
426
+ "rewards/rejected": -2.168546776890289,
427
+ "rewards/accuracies": 0.78125,
428
+ "rewards/margins": 1.0910807690175717,
429
+ "logps/chosen": -57.26282028913498,
430
+ "logps/rejected": -71.84579543352127,
431
+ "epoch": 0.2178310253617551,
432
+ "step": 210
433
+ },
434
+ {
435
+ "loss": 0.44950242042541505,
436
+ "grad_norm": 0.015949787572026253,
437
+ "learning_rate": 7.730569948186528e-06,
438
+ "entropy": 0.718045612655842,
439
+ "num_tokens": 14745903.0,
440
+ "logits/chosen": -1.6029292718575974,
441
+ "logits/rejected": -1.2788201063427131,
442
+ "mean_token_accuracy": 0.7201293612085283,
443
+ "rewards/chosen": -1.034126255120791,
444
+ "rewards/rejected": -2.162680851666955,
445
+ "rewards/accuracies": 0.8025,
446
+ "rewards/margins": 1.1285545978834852,
447
+ "logps/chosen": -58.2793731212616,
448
+ "logps/rejected": -75.22644976615906,
449
+ "epoch": 0.2282039313313625,
450
+ "step": 220
451
+ },
452
+ {
453
+ "loss": 0.43929591178894045,
454
+ "grad_norm": 0.013934735208749771,
455
+ "learning_rate": 7.626943005181348e-06,
456
+ "entropy": 0.7872297932501533,
457
+ "num_tokens": 15418570.0,
458
+ "logits/chosen": -1.4825574599936209,
459
+ "logits/rejected": -1.2401306349486072,
460
+ "mean_token_accuracy": 0.7127851650305093,
461
+ "rewards/chosen": -0.9212520667978242,
462
+ "rewards/rejected": -2.088999391239631,
463
+ "rewards/accuracies": 0.7975,
464
+ "rewards/margins": 1.1677473206445574,
465
+ "logps/chosen": -64.23240270137786,
466
+ "logps/rejected": -75.61436933040619,
467
+ "epoch": 0.23857683730096987,
468
+ "step": 230
469
+ },
470
+ {
471
+ "loss": 0.46149606704711915,
472
+ "grad_norm": 0.016272729262709618,
473
+ "learning_rate": 7.523316062176167e-06,
474
+ "entropy": 0.7730766562063945,
475
+ "num_tokens": 16089276.0,
476
+ "logits/chosen": -1.4998074947450468,
477
+ "logits/rejected": -1.2344424531786968,
478
+ "mean_token_accuracy": 0.7029178227111698,
479
+ "rewards/chosen": -0.9342721946419624,
480
+ "rewards/rejected": -2.0036902719875798,
481
+ "rewards/accuracies": 0.805,
482
+ "rewards/margins": 1.069418080030009,
483
+ "logps/chosen": -61.67156839847565,
484
+ "logps/rejected": -73.40640575170517,
485
+ "epoch": 0.24894974327057726,
486
+ "step": 240
487
+ },
488
+ {
489
+ "loss": 0.46842288970947266,
490
+ "grad_norm": 0.01317604910582304,
491
+ "learning_rate": 7.419689119170985e-06,
492
+ "entropy": 0.7556795614853036,
493
+ "num_tokens": 16760081.0,
494
+ "logits/chosen": -1.5251408018321724,
495
+ "logits/rejected": -1.2550001884745545,
496
+ "mean_token_accuracy": 0.7026587814092636,
497
+ "rewards/chosen": -0.9681878225761466,
498
+ "rewards/rejected": -1.9993022468869457,
499
+ "rewards/accuracies": 0.79625,
500
+ "rewards/margins": 1.031114422827959,
501
+ "logps/chosen": -62.68858078241348,
502
+ "logps/rejected": -72.8400109577179,
503
+ "epoch": 0.2593226492401846,
504
+ "step": 250
505
+ },
506
+ {
507
+ "eval_loss": 0.45063868165016174,
508
+ "eval_runtime": 228.335,
509
+ "eval_samples_per_second": 4.38,
510
+ "eval_steps_per_second": 4.38,
511
+ "eval_entropy": 0.7599611716154031,
512
+ "eval_num_tokens": 16760081.0,
513
+ "eval_logits/chosen": -1.5228878121420686,
514
+ "eval_logits/rejected": -1.2457822987193723,
515
+ "eval_mean_token_accuracy": 0.7089936109930277,
516
+ "eval_rewards/chosen": -0.9581855501902755,
517
+ "eval_rewards/rejected": -2.058153331893496,
518
+ "eval_rewards/accuracies": 0.804,
519
+ "eval_rewards/margins": 1.0999677814096211,
520
+ "eval_logps/chosen": -59.75484214401245,
521
+ "eval_logps/rejected": -73.22140468788147,
522
+ "epoch": 0.2593226492401846,
523
+ "step": 250
524
+ },
525
+ {
526
+ "loss": 0.4814570426940918,
527
+ "grad_norm": 0.015276545658707619,
528
+ "learning_rate": 7.3160621761658035e-06,
529
+ "entropy": 0.7907758677133825,
530
+ "num_tokens": 17432770.0,
531
+ "logits/chosen": -1.5061012207082294,
532
+ "logits/rejected": -1.2302418451410948,
533
+ "mean_token_accuracy": 0.7116011143475771,
534
+ "rewards/chosen": -0.9151591785412165,
535
+ "rewards/rejected": -2.000397002430982,
536
+ "rewards/accuracies": 0.78375,
537
+ "rewards/margins": 1.085237822062336,
538
+ "logps/chosen": -62.86761567592621,
539
+ "logps/rejected": -74.82630295515061,
540
+ "epoch": 0.26969555520979205,
541
+ "step": 260
542
+ },
543
+ {
544
+ "loss": 0.4540716648101807,
545
+ "grad_norm": 0.013052938506007195,
546
+ "learning_rate": 7.212435233160623e-06,
547
+ "entropy": 0.7655438208338455,
548
+ "num_tokens": 18100438.0,
549
+ "logits/chosen": -1.525467093384173,
550
+ "logits/rejected": -1.2448767667260814,
551
+ "mean_token_accuracy": 0.7059390800073743,
552
+ "rewards/chosen": -0.8308528269545059,
553
+ "rewards/rejected": -1.8842440211544453,
554
+ "rewards/accuracies": 0.79375,
555
+ "rewards/margins": 1.0533911933761555,
556
+ "logps/chosen": -56.91530933380127,
557
+ "logps/rejected": -70.32416380643845,
558
+ "epoch": 0.28006846117939943,
559
+ "step": 270
560
+ },
561
+ {
562
+ "loss": 0.44190540313720705,
563
+ "grad_norm": 0.014065246097743511,
564
+ "learning_rate": 7.108808290155441e-06,
565
+ "entropy": 0.7839024822821375,
566
+ "num_tokens": 18772061.0,
567
+ "logits/chosen": -1.5250317827718283,
568
+ "logits/rejected": -1.227351313367144,
569
+ "mean_token_accuracy": 0.7068624695949256,
570
+ "rewards/chosen": -0.8610654402987712,
571
+ "rewards/rejected": -2.0157007031119427,
572
+ "rewards/accuracies": 0.81875,
573
+ "rewards/margins": 1.1546352597884835,
574
+ "logps/chosen": -61.52414802789688,
575
+ "logps/rejected": -72.9297788310051,
576
+ "epoch": 0.2904413671490068,
577
+ "step": 280
578
+ },
579
+ {
580
+ "loss": 0.4456183910369873,
581
+ "grad_norm": 0.015716280788183212,
582
+ "learning_rate": 7.005181347150259e-06,
583
+ "entropy": 0.773276298265555,
584
+ "num_tokens": 19443506.0,
585
+ "logits/chosen": -1.5330978743938402,
586
+ "logits/rejected": -1.2171561791639127,
587
+ "mean_token_accuracy": 0.7161024253070355,
588
+ "rewards/chosen": -0.9044717278318422,
589
+ "rewards/rejected": -2.01870841772703,
590
+ "rewards/accuracies": 0.8025,
591
+ "rewards/margins": 1.1142366893729194,
592
+ "logps/chosen": -60.47999572515488,
593
+ "logps/rejected": -74.31323668241501,
594
+ "epoch": 0.3008142731186142,
595
+ "step": 290
596
+ },
597
+ {
598
+ "loss": 0.44274072647094725,
599
+ "grad_norm": 0.014205160550773144,
600
+ "learning_rate": 6.9015544041450784e-06,
601
+ "entropy": 0.7546117506347946,
602
+ "num_tokens": 20114567.0,
603
+ "logits/chosen": -1.6212462502874232,
604
+ "logits/rejected": -1.3379802284295708,
605
+ "mean_token_accuracy": 0.7209940696135163,
606
+ "rewards/chosen": -0.9589981533990612,
607
+ "rewards/rejected": -2.169916975693777,
608
+ "rewards/accuracies": 0.795,
609
+ "rewards/margins": 1.2109188246540725,
610
+ "logps/chosen": -60.32763281106949,
611
+ "logps/rejected": -75.60327394008637,
612
+ "epoch": 0.3111871790882216,
613
+ "step": 300
614
+ },
615
+ {
616
+ "loss": 0.4552000522613525,
617
+ "grad_norm": 0.014621925540268421,
618
+ "learning_rate": 6.797927461139897e-06,
619
+ "entropy": 0.7755605199559068,
620
+ "num_tokens": 20787766.0,
621
+ "logits/chosen": -1.612899054190608,
622
+ "logits/rejected": -1.3232876722515345,
623
+ "mean_token_accuracy": 0.7147772766277194,
624
+ "rewards/chosen": -0.9240679290609841,
625
+ "rewards/rejected": -2.1595666578254895,
626
+ "rewards/accuracies": 0.79,
627
+ "rewards/margins": 1.2354987265914679,
628
+ "logps/chosen": -61.32829741239548,
629
+ "logps/rejected": -77.28044722557068,
630
+ "epoch": 0.32156008505782896,
631
+ "step": 310
632
+ },
633
+ {
634
+ "loss": 0.4410384178161621,
635
+ "grad_norm": 0.01790008693933487,
636
+ "learning_rate": 6.6943005181347155e-06,
637
+ "entropy": 0.7489672241648077,
638
+ "num_tokens": 21457559.0,
639
+ "logits/chosen": -1.6415965131088623,
640
+ "logits/rejected": -1.347490645506002,
641
+ "mean_token_accuracy": 0.7051716044172645,
642
+ "rewards/chosen": -0.9709404561911651,
643
+ "rewards/rejected": -2.2215542565838406,
644
+ "rewards/accuracies": 0.7925,
645
+ "rewards/margins": 1.250613798997365,
646
+ "logps/chosen": -61.40900204181671,
647
+ "logps/rejected": -75.62910031557084,
648
+ "epoch": 0.33193299102743634,
649
+ "step": 320
650
+ },
651
+ {
652
+ "loss": 0.4336719512939453,
653
+ "grad_norm": 0.014728070236742496,
654
+ "learning_rate": 6.590673575129535e-06,
655
+ "entropy": 0.7923685038526309,
656
+ "num_tokens": 22128277.0,
657
+ "logits/chosen": -1.5480857679147186,
658
+ "logits/rejected": -1.2608543306081368,
659
+ "mean_token_accuracy": 0.703275697156787,
660
+ "rewards/chosen": -0.9459266294135409,
661
+ "rewards/rejected": -2.2482709953014273,
662
+ "rewards/accuracies": 0.80875,
663
+ "rewards/margins": 1.3023443661583587,
664
+ "logps/chosen": -60.81426377058029,
665
+ "logps/rejected": -77.32076614141464,
666
+ "epoch": 0.3423058969970437,
667
+ "step": 330
668
+ },
669
+ {
670
+ "loss": 0.4488088130950928,
671
+ "grad_norm": 0.01915821246802807,
672
+ "learning_rate": 6.487046632124353e-06,
673
+ "entropy": 0.7655984267906751,
674
+ "num_tokens": 22798429.0,
675
+ "logits/chosen": -1.5794928447393075,
676
+ "logits/rejected": -1.3028102903528602,
677
+ "mean_token_accuracy": 0.7063317270204424,
678
+ "rewards/chosen": -0.9481951130661764,
679
+ "rewards/rejected": -2.169792889961391,
680
+ "rewards/accuracies": 0.7975,
681
+ "rewards/margins": 1.2215977760369423,
682
+ "logps/chosen": -60.23724600553513,
683
+ "logps/rejected": -74.96227306127548,
684
+ "epoch": 0.3526788029666511,
685
+ "step": 340
686
+ },
687
+ {
688
+ "loss": 0.4490936756134033,
689
+ "grad_norm": 0.017944717779755592,
690
+ "learning_rate": 6.383419689119171e-06,
691
+ "entropy": 0.7542878538439982,
692
+ "num_tokens": 23470239.0,
693
+ "logits/chosen": -1.5727406857545416,
694
+ "logits/rejected": -1.276317261399869,
695
+ "mean_token_accuracy": 0.7159937589988112,
696
+ "rewards/chosen": -0.9953277947314564,
697
+ "rewards/rejected": -2.3134128075395712,
698
+ "rewards/accuracies": 0.79875,
699
+ "rewards/margins": 1.3180850110016764,
700
+ "logps/chosen": -61.82909578323364,
701
+ "logps/rejected": -78.39685034513474,
702
+ "epoch": 0.3630517089362585,
703
+ "step": 350
704
+ },
705
+ {
706
+ "loss": 0.4634250640869141,
707
+ "grad_norm": 0.017308367416262627,
708
+ "learning_rate": 6.2797927461139905e-06,
709
+ "entropy": 0.7325191626208835,
710
+ "num_tokens": 24140239.0,
711
+ "logits/chosen": -1.6208129462287795,
712
+ "logits/rejected": -1.3357805451866935,
713
+ "mean_token_accuracy": 0.7167608435824513,
714
+ "rewards/chosen": -0.9554049956912786,
715
+ "rewards/rejected": -2.160907984265359,
716
+ "rewards/accuracies": 0.7925,
717
+ "rewards/margins": 1.205502986907959,
718
+ "logps/chosen": -60.00006797075272,
719
+ "logps/rejected": -73.66487602233887,
720
+ "epoch": 0.37342461490586587,
721
+ "step": 360
722
+ },
723
+ {
724
+ "loss": 0.4462597846984863,
725
+ "grad_norm": 0.012704321183264256,
726
+ "learning_rate": 6.176165803108809e-06,
727
+ "entropy": 0.7730704579531448,
728
+ "num_tokens": 24812178.0,
729
+ "logits/chosen": -1.5574609696072523,
730
+ "logits/rejected": -1.260951689955208,
731
+ "mean_token_accuracy": 0.7079000303149223,
732
+ "rewards/chosen": -0.9217178278604843,
733
+ "rewards/rejected": -2.219055590032367,
734
+ "rewards/accuracies": 0.79875,
735
+ "rewards/margins": 1.2973377590533346,
736
+ "logps/chosen": -63.260009841918944,
737
+ "logps/rejected": -75.37872500896454,
738
+ "epoch": 0.38379752087547325,
739
+ "step": 370
740
+ },
741
+ {
742
+ "eval_loss": 0.4316043555736542,
743
+ "eval_runtime": 247.4497,
744
+ "eval_samples_per_second": 4.041,
745
+ "eval_steps_per_second": 4.041,
746
+ "eval_entropy": 0.7676939936636481,
747
+ "eval_num_tokens": 25147105.0,
748
+ "eval_logits/chosen": -1.5026115886795766,
749
+ "eval_logits/rejected": -1.2167814175886924,
750
+ "eval_mean_token_accuracy": 0.7118223344534635,
751
+ "eval_rewards/chosen": -0.7611177709406475,
752
+ "eval_rewards/rejected": -1.9837484061150754,
753
+ "eval_rewards/accuracies": 0.812,
754
+ "eval_rewards/margins": 1.2226306333914398,
755
+ "eval_logps/chosen": -57.784164419174196,
756
+ "eval_logps/rejected": -72.47735544586182,
757
+ "epoch": 0.38898397386027694,
758
+ "step": 375
759
+ },
760
+ {
761
+ "loss": 0.42072787284851076,
762
+ "grad_norm": 0.01512940414249897,
763
+ "learning_rate": 6.0725388601036275e-06,
764
+ "entropy": 0.7662378180027009,
765
+ "num_tokens": 25482532.0,
766
+ "logits/chosen": -1.4455535287130075,
767
+ "logits/rejected": -1.1827597378991437,
768
+ "mean_token_accuracy": 0.7134129768237472,
769
+ "rewards/chosen": -0.7430938966096438,
770
+ "rewards/rejected": -1.9754590333898159,
771
+ "rewards/accuracies": 0.81625,
772
+ "rewards/margins": 1.2323651346145197,
773
+ "logps/chosen": -59.126625483036044,
774
+ "logps/rejected": -71.10404143095016,
775
+ "epoch": 0.39417042684508063,
776
+ "step": 380
777
+ },
778
+ {
779
+ "loss": 0.4370901107788086,
780
+ "grad_norm": 0.013698432594537735,
781
+ "learning_rate": 5.968911917098445e-06,
782
+ "entropy": 0.7876232456968865,
783
+ "num_tokens": 26154266.0,
784
+ "logits/chosen": -1.4235855556360628,
785
+ "logits/rejected": -1.1775204862100577,
786
+ "mean_token_accuracy": 0.7055446618422866,
787
+ "rewards/chosen": -0.7474835715969129,
788
+ "rewards/rejected": -1.9929245413161698,
789
+ "rewards/accuracies": 0.81125,
790
+ "rewards/margins": 1.2454409682005645,
791
+ "logps/chosen": -60.49559247493744,
792
+ "logps/rejected": -74.38287235736847,
793
+ "epoch": 0.404543332814688,
794
+ "step": 390
795
+ },
796
+ {
797
+ "loss": 0.43750705718994143,
798
+ "grad_norm": 0.014688065275549889,
799
+ "learning_rate": 5.865284974093265e-06,
800
+ "entropy": 0.8005011603605817,
801
+ "num_tokens": 26825159.0,
802
+ "logits/chosen": -1.4366348824569963,
803
+ "logits/rejected": -1.1432329035500064,
804
+ "mean_token_accuracy": 0.7120773574337363,
805
+ "rewards/chosen": -0.7654138012278418,
806
+ "rewards/rejected": -1.9986112341369153,
807
+ "rewards/accuracies": 0.80625,
808
+ "rewards/margins": 1.2331974321743473,
809
+ "logps/chosen": -59.77998896837234,
810
+ "logps/rejected": -74.2601730799675,
811
+ "epoch": 0.4149162387842954,
812
+ "step": 400
813
+ },
814
+ {
815
+ "loss": 0.4483372211456299,
816
+ "grad_norm": 0.01656300760805607,
817
+ "learning_rate": 5.761658031088083e-06,
818
+ "entropy": 0.7781640422128839,
819
+ "num_tokens": 27495663.0,
820
+ "logits/chosen": -1.469463162115489,
821
+ "logits/rejected": -1.1635286970905576,
822
+ "mean_token_accuracy": 0.7104245729371905,
823
+ "rewards/chosen": -0.7733871162302784,
824
+ "rewards/rejected": -2.009647502012085,
825
+ "rewards/accuracies": 0.7775,
826
+ "rewards/margins": 1.236260382984765,
827
+ "logps/chosen": -59.314085538387296,
828
+ "logps/rejected": -73.74020329475402,
829
+ "epoch": 0.4252891447539028,
830
+ "step": 410
831
+ },
832
+ {
833
+ "loss": 0.40839343070983886,
834
+ "grad_norm": 0.014693827368319035,
835
+ "learning_rate": 5.658031088082902e-06,
836
+ "entropy": 0.7646654536006827,
837
+ "num_tokens": 28167389.0,
838
+ "logits/chosen": -1.5559907884752369,
839
+ "logits/rejected": -1.2529527889366994,
840
+ "mean_token_accuracy": 0.7122585397399962,
841
+ "rewards/chosen": -0.812723506633156,
842
+ "rewards/rejected": -2.2211731961916668,
843
+ "rewards/accuracies": 0.8325,
844
+ "rewards/margins": 1.4084496867936105,
845
+ "logps/chosen": -61.519875913858414,
846
+ "logps/rejected": -76.1291908788681,
847
+ "epoch": 0.4356620507235102,
848
+ "step": 420
849
+ },
850
+ {
851
+ "loss": 0.4050635814666748,
852
+ "grad_norm": 0.014569880440831184,
853
+ "learning_rate": 5.554404145077721e-06,
854
+ "entropy": 0.7813236166906427,
855
+ "num_tokens": 28839388.0,
856
+ "logits/chosen": -1.4355108492016981,
857
+ "logits/rejected": -1.1415682707849564,
858
+ "mean_token_accuracy": 0.7073199293017387,
859
+ "rewards/chosen": -0.8523474504226578,
860
+ "rewards/rejected": -2.3254094777817955,
861
+ "rewards/accuracies": 0.82,
862
+ "rewards/margins": 1.4730620284751057,
863
+ "logps/chosen": -60.116721353530885,
864
+ "logps/rejected": -76.6921053647995,
865
+ "epoch": 0.4460349566931176,
866
+ "step": 430
867
+ },
868
+ {
869
+ "loss": 0.40834870338439944,
870
+ "grad_norm": 0.01712818816304207,
871
+ "learning_rate": 5.4507772020725395e-06,
872
+ "entropy": 0.7444785924613825,
873
+ "num_tokens": 29510096.0,
874
+ "logits/chosen": -1.6494087471154035,
875
+ "logits/rejected": -1.2686231425397783,
876
+ "mean_token_accuracy": 0.7219790226966143,
877
+ "rewards/chosen": -0.9436784289986826,
878
+ "rewards/rejected": -2.380959646940464,
879
+ "rewards/accuracies": 0.82875,
880
+ "rewards/margins": 1.4372812157822772,
881
+ "logps/chosen": -59.11840226888657,
882
+ "logps/rejected": -76.61158362627029,
883
+ "epoch": 0.456407862662725,
884
+ "step": 440
885
+ },
886
+ {
887
+ "loss": 0.44087815284729004,
888
+ "grad_norm": 0.022262893617153168,
889
+ "learning_rate": 5.347150259067357e-06,
890
+ "entropy": 0.7486801335980999,
891
+ "num_tokens": 30181792.0,
892
+ "logits/chosen": -1.6525915875287975,
893
+ "logits/rejected": -1.292702118780194,
894
+ "mean_token_accuracy": 0.7041960602998734,
895
+ "rewards/chosen": -1.0031295236017104,
896
+ "rewards/rejected": -2.4976175978421815,
897
+ "rewards/accuracies": 0.805,
898
+ "rewards/margins": 1.4944880706071855,
899
+ "logps/chosen": -61.45527629375458,
900
+ "logps/rejected": -78.80332666873932,
901
+ "epoch": 0.46678076863233237,
902
+ "step": 450
903
+ },
904
+ {
905
+ "loss": 0.41168813705444335,
906
+ "grad_norm": 0.01639724150300026,
907
+ "learning_rate": 5.243523316062177e-06,
908
+ "entropy": 0.7348720514599699,
909
+ "num_tokens": 30851409.0,
910
+ "logits/chosen": -1.6804476245129396,
911
+ "logits/rejected": -1.3568483163933152,
912
+ "mean_token_accuracy": 0.7089731366932392,
913
+ "rewards/chosen": -0.9868619644123828,
914
+ "rewards/rejected": -2.5387522551673465,
915
+ "rewards/accuracies": 0.8125,
916
+ "rewards/margins": 1.5518902849871665,
917
+ "logps/chosen": -61.486987377405164,
918
+ "logps/rejected": -78.15051867246628,
919
+ "epoch": 0.47715367460193975,
920
+ "step": 460
921
+ },
922
+ {
923
+ "loss": 0.44434194564819335,
924
+ "grad_norm": 0.021561825647950172,
925
+ "learning_rate": 5.139896373056995e-06,
926
+ "entropy": 0.7410113723303948,
927
+ "num_tokens": 31519564.0,
928
+ "logits/chosen": -1.640166155420613,
929
+ "logits/rejected": -1.3236098037357882,
930
+ "mean_token_accuracy": 0.7085670954920351,
931
+ "rewards/chosen": -0.9577470733088558,
932
+ "rewards/rejected": -2.3723132372720284,
933
+ "rewards/accuracies": 0.80125,
934
+ "rewards/margins": 1.4145661635301077,
935
+ "logps/chosen": -59.36082991600037,
936
+ "logps/rejected": -74.87610804796219,
937
+ "epoch": 0.48752658057154713,
938
+ "step": 470
939
+ },
940
+ {
941
+ "loss": 0.4187155723571777,
942
+ "grad_norm": 0.015293825417757034,
943
+ "learning_rate": 5.036269430051814e-06,
944
+ "entropy": 0.819734820156591,
945
+ "num_tokens": 32192056.0,
946
+ "logits/chosen": -1.4117972345061844,
947
+ "logits/rejected": -1.1251919844105895,
948
+ "mean_token_accuracy": 0.699143321532756,
949
+ "rewards/chosen": -0.827813671599506,
950
+ "rewards/rejected": -2.1753858611593024,
951
+ "rewards/accuracies": 0.82125,
952
+ "rewards/margins": 1.347572191953659,
953
+ "logps/chosen": -62.310746512413026,
954
+ "logps/rejected": -76.46800751209258,
955
+ "epoch": 0.4978994865411545,
956
+ "step": 480
957
+ },
958
+ {
959
+ "loss": 0.41543288230895997,
960
+ "grad_norm": 0.016549421474337578,
961
+ "learning_rate": 4.932642487046633e-06,
962
+ "entropy": 0.793799487358192,
963
+ "num_tokens": 32864077.0,
964
+ "logits/chosen": -1.45461478674727,
965
+ "logits/rejected": -1.1643940857008355,
966
+ "mean_token_accuracy": 0.7187336018308997,
967
+ "rewards/chosen": -0.8021746008354603,
968
+ "rewards/rejected": -2.22868984402754,
969
+ "rewards/accuracies": 0.82,
970
+ "rewards/margins": 1.4265152450464667,
971
+ "logps/chosen": -58.781578176021576,
972
+ "logps/rejected": -78.34760097026825,
973
+ "epoch": 0.5082723925107618,
974
+ "step": 490
975
+ },
976
+ {
977
+ "loss": 0.4357460498809814,
978
+ "grad_norm": 0.015738829970359802,
979
+ "learning_rate": 4.829015544041451e-06,
980
+ "entropy": 0.7886733054189244,
981
+ "num_tokens": 33534279.0,
982
+ "logits/chosen": -1.482443230472497,
983
+ "logits/rejected": -1.1571150498996416,
984
+ "mean_token_accuracy": 0.7196742885001004,
985
+ "rewards/chosen": -0.7262393125944072,
986
+ "rewards/rejected": -2.081412044418103,
987
+ "rewards/accuracies": 0.80375,
988
+ "rewards/margins": 1.3551727333851158,
989
+ "logps/chosen": -56.740478208065035,
990
+ "logps/rejected": -74.49606896877289,
991
+ "epoch": 0.5186452984803692,
992
+ "step": 500
993
+ },
994
+ {
995
+ "eval_loss": 0.42026275396347046,
996
+ "eval_runtime": 281.7739,
997
+ "eval_samples_per_second": 3.549,
998
+ "eval_steps_per_second": 3.549,
999
+ "eval_entropy": 0.7882621039540972,
1000
+ "eval_num_tokens": 33534279.0,
1001
+ "eval_logits/chosen": -1.4541776191798497,
1002
+ "eval_logits/rejected": -1.1470192806607813,
1003
+ "eval_mean_token_accuracy": 0.7118717866092921,
1004
+ "eval_rewards/chosen": -0.7887642608310853,
1005
+ "eval_rewards/rejected": -2.164067000001669,
1006
+ "eval_rewards/accuracies": 0.818,
1007
+ "eval_rewards/margins": 1.3753027384020389,
1008
+ "eval_logps/chosen": -58.06062930107117,
1009
+ "eval_logps/rejected": -74.28054134368897,
1010
+ "epoch": 0.5186452984803692,
1011
+ "step": 500
1012
+ },
1013
+ {
1014
+ "loss": 0.4276765823364258,
1015
+ "grad_norm": 0.014744630083441734,
1016
+ "learning_rate": 4.72538860103627e-06,
1017
+ "entropy": 0.7855714731411717,
1018
+ "num_tokens": 34205135.0,
1019
+ "logits/chosen": -1.4180048717028029,
1020
+ "logits/rejected": -1.1214338358385025,
1021
+ "mean_token_accuracy": 0.7126064065098763,
1022
+ "rewards/chosen": -0.82133626240171,
1023
+ "rewards/rejected": -2.191293025066843,
1024
+ "rewards/accuracies": 0.8175,
1025
+ "rewards/margins": 1.3699567627965008,
1026
+ "logps/chosen": -59.999370622634885,
1027
+ "logps/rejected": -74.11055833339691,
1028
+ "epoch": 0.5290182044499767,
1029
+ "step": 510
1030
+ },
1031
+ {
1032
+ "loss": 0.4480290412902832,
1033
+ "grad_norm": 0.016974102705717087,
1034
+ "learning_rate": 4.621761658031089e-06,
1035
+ "entropy": 0.7657113060192206,
1036
+ "num_tokens": 34873976.0,
1037
+ "logits/chosen": -1.4652295046030377,
1038
+ "logits/rejected": -1.1381464982050828,
1039
+ "mean_token_accuracy": 0.7193653728254139,
1040
+ "rewards/chosen": -0.8232743983055844,
1041
+ "rewards/rejected": -2.115962935181451,
1042
+ "rewards/accuracies": 0.79,
1043
+ "rewards/margins": 1.2926885320199653,
1044
+ "logps/chosen": -57.11219574928284,
1045
+ "logps/rejected": -72.7778330230713,
1046
+ "epoch": 0.5393911104195841,
1047
+ "step": 520
1048
+ },
1049
+ {
1050
+ "loss": 0.4185093879699707,
1051
+ "grad_norm": 0.014205333776772022,
1052
+ "learning_rate": 4.518134715025907e-06,
1053
+ "entropy": 0.8013994769033161,
1054
+ "num_tokens": 35544999.0,
1055
+ "logits/chosen": -1.471904915902926,
1056
+ "logits/rejected": -1.1525475558082925,
1057
+ "mean_token_accuracy": 0.7086275420710444,
1058
+ "rewards/chosen": -0.821920394521876,
1059
+ "rewards/rejected": -2.3078401576905163,
1060
+ "rewards/accuracies": 0.8275,
1061
+ "rewards/margins": 1.4859197605680674,
1062
+ "logps/chosen": -60.18735828638077,
1063
+ "logps/rejected": -76.90893436431885,
1064
+ "epoch": 0.5497640163891915,
1065
+ "step": 530
1066
+ },
1067
+ {
1068
+ "loss": 0.43764190673828124,
1069
+ "grad_norm": 0.01859429106116295,
1070
+ "learning_rate": 4.414507772020726e-06,
1071
+ "entropy": 0.8030325107637327,
1072
+ "num_tokens": 36215629.0,
1073
+ "logits/chosen": -1.3828510403033027,
1074
+ "logits/rejected": -1.1259861866767447,
1075
+ "mean_token_accuracy": 0.7117785899341107,
1076
+ "rewards/chosen": -0.8377752207776211,
1077
+ "rewards/rejected": -2.164465318453731,
1078
+ "rewards/accuracies": 0.8325,
1079
+ "rewards/margins": 1.3266900933114811,
1080
+ "logps/chosen": -59.40348263263702,
1081
+ "logps/rejected": -73.95402544498444,
1082
+ "epoch": 0.5601369223587989,
1083
+ "step": 540
1084
+ },
1085
+ {
1086
+ "loss": 0.43619637489318847,
1087
+ "grad_norm": 0.022518545389175415,
1088
+ "learning_rate": 4.310880829015544e-06,
1089
+ "entropy": 0.8470213223638712,
1090
+ "num_tokens": 36888235.0,
1091
+ "logits/chosen": -1.3614448333016513,
1092
+ "logits/rejected": -1.0777429963848568,
1093
+ "mean_token_accuracy": 0.7116067171096802,
1094
+ "rewards/chosen": -0.8179999309696723,
1095
+ "rewards/rejected": -2.2714405926934886,
1096
+ "rewards/accuracies": 0.8025,
1097
+ "rewards/margins": 1.453440659949556,
1098
+ "logps/chosen": -61.603306529521944,
1099
+ "logps/rejected": -78.86535804271698,
1100
+ "epoch": 0.5705098283284062,
1101
+ "step": 550
1102
+ },
1103
+ {
1104
+ "loss": 0.4372966766357422,
1105
+ "grad_norm": 0.017818979918956757,
1106
+ "learning_rate": 4.207253886010363e-06,
1107
+ "entropy": 0.8097228137392085,
1108
+ "num_tokens": 37560215.0,
1109
+ "logits/chosen": -1.4065342416818991,
1110
+ "logits/rejected": -1.1310520368013937,
1111
+ "mean_token_accuracy": 0.7106514018215239,
1112
+ "rewards/chosen": -0.7871383707236419,
1113
+ "rewards/rejected": -2.1830000240239316,
1114
+ "rewards/accuracies": 0.79375,
1115
+ "rewards/margins": 1.3958616532059387,
1116
+ "logps/chosen": -59.665771260261536,
1117
+ "logps/rejected": -74.6952103304863,
1118
+ "epoch": 0.5808827342980136,
1119
+ "step": 560
1120
+ },
1121
+ {
1122
+ "loss": 0.4129640102386475,
1123
+ "grad_norm": 0.01815822720527649,
1124
+ "learning_rate": 4.103626943005182e-06,
1125
+ "entropy": 0.7890104844880989,
1126
+ "num_tokens": 38229872.0,
1127
+ "logits/chosen": -1.4210442868235984,
1128
+ "logits/rejected": -1.1203699372972569,
1129
+ "mean_token_accuracy": 0.7099655389133841,
1130
+ "rewards/chosen": -0.8200407591336989,
1131
+ "rewards/rejected": -2.2342929665278644,
1132
+ "rewards/accuracies": 0.83,
1133
+ "rewards/margins": 1.4142522051371633,
1134
+ "logps/chosen": -59.6181519818306,
1135
+ "logps/rejected": -74.29007930994034,
1136
+ "epoch": 0.591255640267621,
1137
+ "step": 570
1138
+ },
1139
+ {
1140
+ "loss": 0.4248640537261963,
1141
+ "grad_norm": 0.021521631628274918,
1142
+ "learning_rate": 4.000000000000001e-06,
1143
+ "entropy": 0.7830230033496628,
1144
+ "num_tokens": 38898599.0,
1145
+ "logits/chosen": -1.556829666838658,
1146
+ "logits/rejected": -1.22248957027324,
1147
+ "mean_token_accuracy": 0.7121115596592427,
1148
+ "rewards/chosen": -0.8376483802072471,
1149
+ "rewards/rejected": -2.30365946133883,
1150
+ "rewards/accuracies": 0.82,
1151
+ "rewards/margins": 1.466011079289019,
1152
+ "logps/chosen": -57.19522080659866,
1153
+ "logps/rejected": -74.76314610958099,
1154
+ "epoch": 0.6016285462372284,
1155
+ "step": 580
1156
+ },
1157
+ {
1158
+ "loss": 0.46982684135437014,
1159
+ "grad_norm": 0.0202327873557806,
1160
+ "learning_rate": 3.896373056994819e-06,
1161
+ "entropy": 0.789131090187293,
1162
+ "num_tokens": 39570011.0,
1163
+ "logits/chosen": -1.4979756501997874,
1164
+ "logits/rejected": -1.2087421360795596,
1165
+ "mean_token_accuracy": 0.7092419915273785,
1166
+ "rewards/chosen": -0.9460587426692837,
1167
+ "rewards/rejected": -2.2724328075315863,
1168
+ "rewards/accuracies": 0.77125,
1169
+ "rewards/margins": 1.3263740684324876,
1170
+ "logps/chosen": -61.68762954473495,
1171
+ "logps/rejected": -76.94917388081551,
1172
+ "epoch": 0.6120014522068358,
1173
+ "step": 590
1174
+ },
1175
+ {
1176
+ "loss": 0.4296851634979248,
1177
+ "grad_norm": 0.023099711164832115,
1178
+ "learning_rate": 3.7927461139896377e-06,
1179
+ "entropy": 0.7784710348435329,
1180
+ "num_tokens": 40238459.0,
1181
+ "logits/chosen": -1.5463305650925598,
1182
+ "logits/rejected": -1.1855332843764201,
1183
+ "mean_token_accuracy": 0.7213506529480219,
1184
+ "rewards/chosen": -0.7897813039762969,
1185
+ "rewards/rejected": -2.1785082579992014,
1186
+ "rewards/accuracies": 0.80625,
1187
+ "rewards/margins": 1.388726954490412,
1188
+ "logps/chosen": -55.0355699801445,
1189
+ "logps/rejected": -74.42590669631959,
1190
+ "epoch": 0.6223743581764432,
1191
+ "step": 600
1192
+ },
1193
+ {
1194
+ "loss": 0.4378302574157715,
1195
+ "grad_norm": 0.017044473439455032,
1196
+ "learning_rate": 3.6891191709844567e-06,
1197
+ "entropy": 0.8122139454813442,
1198
+ "num_tokens": 40907823.0,
1199
+ "logits/chosen": -1.4782042004502953,
1200
+ "logits/rejected": -1.1733026566264682,
1201
+ "mean_token_accuracy": 0.7134785779751838,
1202
+ "rewards/chosen": -0.7893356951180612,
1203
+ "rewards/rejected": -2.1324991090265395,
1204
+ "rewards/accuracies": 0.81125,
1205
+ "rewards/margins": 1.3431634148815648,
1206
+ "logps/chosen": -56.50307439565658,
1207
+ "logps/rejected": -74.36804901599884,
1208
+ "epoch": 0.6327472641460505,
1209
+ "step": 610
1210
+ },
1211
+ {
1212
+ "loss": 0.42770676612854003,
1213
+ "grad_norm": 0.017237193882465363,
1214
+ "learning_rate": 3.5854922279792748e-06,
1215
+ "entropy": 0.7561554417069419,
1216
+ "num_tokens": 41576629.0,
1217
+ "logits/chosen": -1.5855324711359189,
1218
+ "logits/rejected": -1.2464155038601519,
1219
+ "mean_token_accuracy": 0.7195479864627123,
1220
+ "rewards/chosen": -0.7948263869498987,
1221
+ "rewards/rejected": -2.2129694822058084,
1222
+ "rewards/accuracies": 0.81375,
1223
+ "rewards/margins": 1.4181430943030864,
1224
+ "logps/chosen": -55.47762014627457,
1225
+ "logps/rejected": -74.27213495016098,
1226
+ "epoch": 0.6431201701156579,
1227
+ "step": 620
1228
+ },
1229
+ {
1230
+ "eval_loss": 0.4145970344543457,
1231
+ "eval_runtime": 312.4458,
1232
+ "eval_samples_per_second": 3.201,
1233
+ "eval_steps_per_second": 3.201,
1234
+ "eval_entropy": 0.7926596267716959,
1235
+ "eval_num_tokens": 41911681.0,
1236
+ "eval_logits/chosen": -1.5117800904965717,
1237
+ "eval_logits/rejected": -1.196360660912854,
1238
+ "eval_mean_token_accuracy": 0.7107393295019865,
1239
+ "eval_rewards/chosen": -0.7929535148476134,
1240
+ "eval_rewards/rejected": -2.2358115541365695,
1241
+ "eval_rewards/accuracies": 0.82,
1242
+ "eval_rewards/margins": 1.442858038464561,
1243
+ "eval_logps/chosen": -58.102521854400635,
1244
+ "eval_logps/rejected": -74.9979869003296,
1245
+ "epoch": 0.6483066231004616,
1246
+ "step": 625
1247
+ },
1248
+ {
1249
+ "loss": 0.4174999713897705,
1250
+ "grad_norm": 0.023992126807570457,
1251
+ "learning_rate": 3.4818652849740937e-06,
1252
+ "entropy": 0.7907538907864364,
1253
+ "num_tokens": 42247859.0,
1254
+ "logits/chosen": -1.5275107018411662,
1255
+ "logits/rejected": -1.1729716012203115,
1256
+ "mean_token_accuracy": 0.7168286069855094,
1257
+ "rewards/chosen": -0.785840036013833,
1258
+ "rewards/rejected": -2.3167090034011926,
1259
+ "rewards/accuracies": 0.82,
1260
+ "rewards/margins": 1.5308689690474422,
1261
+ "logps/chosen": -56.834257082939146,
1262
+ "logps/rejected": -78.19684539794922,
1263
+ "epoch": 0.6534930760852653,
1264
+ "step": 630
1265
+ },
1266
+ {
1267
+ "loss": 0.4136983394622803,
1268
+ "grad_norm": 0.017943687736988068,
1269
+ "learning_rate": 3.3782383419689123e-06,
1270
+ "entropy": 0.782110237882007,
1271
+ "num_tokens": 42918160.0,
1272
+ "logits/chosen": -1.5180649119494551,
1273
+ "logits/rejected": -1.1926738964700518,
1274
+ "mean_token_accuracy": 0.7150443252548575,
1275
+ "rewards/chosen": -0.8211558357491231,
1276
+ "rewards/rejected": -2.2642588213164707,
1277
+ "rewards/accuracies": 0.82875,
1278
+ "rewards/margins": 1.4431029830686748,
1279
+ "logps/chosen": -56.69160728216171,
1280
+ "logps/rejected": -77.15469831943511,
1281
+ "epoch": 0.6638659820548727,
1282
+ "step": 640
1283
+ },
1284
+ {
1285
+ "loss": 0.46654863357543946,
1286
+ "grad_norm": 0.016258180141448975,
1287
+ "learning_rate": 3.274611398963731e-06,
1288
+ "entropy": 0.781107221354032,
1289
+ "num_tokens": 43587843.0,
1290
+ "logits/chosen": -1.5242385121688045,
1291
+ "logits/rejected": -1.2121969127570629,
1292
+ "mean_token_accuracy": 0.7117258696630597,
1293
+ "rewards/chosen": -0.8765105128889991,
1294
+ "rewards/rejected": -2.300915027359915,
1295
+ "rewards/accuracies": 0.79625,
1296
+ "rewards/margins": 1.4244045152794569,
1297
+ "logps/chosen": -58.10146237373352,
1298
+ "logps/rejected": -75.90745508432389,
1299
+ "epoch": 0.6742388880244801,
1300
+ "step": 650
1301
+ },
1302
+ {
1303
+ "loss": 0.46282315254211426,
1304
+ "grad_norm": 0.014686384238302708,
1305
+ "learning_rate": 3.1709844559585493e-06,
1306
+ "entropy": 0.7962630777983577,
1307
+ "num_tokens": 44256661.0,
1308
+ "logits/chosen": -1.4734712758844637,
1309
+ "logits/rejected": -1.1916934080775792,
1310
+ "mean_token_accuracy": 0.7055912931449712,
1311
+ "rewards/chosen": -0.7513918488781929,
1312
+ "rewards/rejected": -2.0676744230859914,
1313
+ "rewards/accuracies": 0.8025,
1314
+ "rewards/margins": 1.316282574729994,
1315
+ "logps/chosen": -57.497248324155805,
1316
+ "logps/rejected": -72.39635850191117,
1317
+ "epoch": 0.6846117939940874,
1318
+ "step": 660
1319
+ },
1320
+ {
1321
+ "loss": 0.38728673458099366,
1322
+ "grad_norm": 0.012905064970254898,
1323
+ "learning_rate": 3.0673575129533683e-06,
1324
+ "entropy": 0.7850103608728386,
1325
+ "num_tokens": 44928208.0,
1326
+ "logits/chosen": -1.4906549367707287,
1327
+ "logits/rejected": -1.1785130829765196,
1328
+ "mean_token_accuracy": 0.7167331029660999,
1329
+ "rewards/chosen": -0.729108623168795,
1330
+ "rewards/rejected": -2.2293507476183003,
1331
+ "rewards/accuracies": 0.835,
1332
+ "rewards/margins": 1.500242124721408,
1333
+ "logps/chosen": -57.06263860464096,
1334
+ "logps/rejected": -75.03939726114272,
1335
+ "epoch": 0.6949846999636948,
1336
+ "step": 670
1337
+ },
1338
+ {
1339
+ "loss": 0.42326745986938474,
1340
+ "grad_norm": 0.020321018993854523,
1341
+ "learning_rate": 2.963730569948187e-06,
1342
+ "entropy": 0.8228285726247122,
1343
+ "num_tokens": 45599959.0,
1344
+ "logits/chosen": -1.4107692209920355,
1345
+ "logits/rejected": -1.1415338745002617,
1346
+ "mean_token_accuracy": 0.7098798759281635,
1347
+ "rewards/chosen": -0.7472892588960599,
1348
+ "rewards/rejected": -2.205724095766054,
1349
+ "rewards/accuracies": 0.82,
1350
+ "rewards/margins": 1.4584348343219609,
1351
+ "logps/chosen": -60.79011604785919,
1352
+ "logps/rejected": -76.145639398098,
1353
+ "epoch": 0.7053576059333022,
1354
+ "step": 680
1355
+ },
1356
+ {
1357
+ "loss": 0.46504626274108884,
1358
+ "grad_norm": 0.026528460904955864,
1359
+ "learning_rate": 2.8601036269430053e-06,
1360
+ "entropy": 0.8374029883276671,
1361
+ "num_tokens": 46271100.0,
1362
+ "logits/chosen": -1.438753673313662,
1363
+ "logits/rejected": -1.1758532082539777,
1364
+ "mean_token_accuracy": 0.7012219382543117,
1365
+ "rewards/chosen": -0.8035630289492474,
1366
+ "rewards/rejected": -2.1134093309140733,
1367
+ "rewards/accuracies": 0.78875,
1368
+ "rewards/margins": 1.3098462954116985,
1369
+ "logps/chosen": -60.888806674480435,
1370
+ "logps/rejected": -75.00253082275391,
1371
+ "epoch": 0.7157305119029096,
1372
+ "step": 690
1373
+ },
1374
+ {
1375
+ "loss": 0.3986149072647095,
1376
+ "grad_norm": 0.014411377720534801,
1377
+ "learning_rate": 2.7564766839378243e-06,
1378
+ "entropy": 0.8010915271285921,
1379
+ "num_tokens": 46940588.0,
1380
+ "logits/chosen": -1.4958920674077623,
1381
+ "logits/rejected": -1.1794351626729602,
1382
+ "mean_token_accuracy": 0.7159527142904699,
1383
+ "rewards/chosen": -0.7098511749218233,
1384
+ "rewards/rejected": -2.1309537043143063,
1385
+ "rewards/accuracies": 0.83,
1386
+ "rewards/margins": 1.4211025240272284,
1387
+ "logps/chosen": -58.82859611272812,
1388
+ "logps/rejected": -71.86115275144577,
1389
+ "epoch": 0.726103417872517,
1390
+ "step": 700
1391
+ },
1392
+ {
1393
+ "loss": 0.43906688690185547,
1394
+ "grad_norm": 0.01570284552872181,
1395
+ "learning_rate": 2.6528497409326424e-06,
1396
+ "entropy": 0.7988389390867087,
1397
+ "num_tokens": 47612649.0,
1398
+ "logits/chosen": -1.5084893760106768,
1399
+ "logits/rejected": -1.2217334834194045,
1400
+ "mean_token_accuracy": 0.7133530013635755,
1401
+ "rewards/chosen": -0.7729418969854669,
1402
+ "rewards/rejected": -2.181924787040334,
1403
+ "rewards/accuracies": 0.795,
1404
+ "rewards/margins": 1.4089828893507366,
1405
+ "logps/chosen": -61.10609317064285,
1406
+ "logps/rejected": -74.83846760034561,
1407
+ "epoch": 0.7364763238421244,
1408
+ "step": 710
1409
+ },
1410
+ {
1411
+ "loss": 0.40947885513305665,
1412
+ "grad_norm": 0.023827839642763138,
1413
+ "learning_rate": 2.5492227979274614e-06,
1414
+ "entropy": 0.7832058588406653,
1415
+ "num_tokens": 48280316.0,
1416
+ "logits/chosen": -1.5411506649745486,
1417
+ "logits/rejected": -1.2429037100661278,
1418
+ "mean_token_accuracy": 0.7112616512458771,
1419
+ "rewards/chosen": -0.6660112939180545,
1420
+ "rewards/rejected": -2.1130318040723797,
1421
+ "rewards/accuracies": 0.82375,
1422
+ "rewards/margins": 1.4470205087191426,
1423
+ "logps/chosen": -56.754196836948395,
1424
+ "logps/rejected": -72.01071586370468,
1425
+ "epoch": 0.7468492298117317,
1426
+ "step": 720
1427
+ },
1428
+ {
1429
+ "loss": 0.4252438545227051,
1430
+ "grad_norm": 0.016843726858496666,
1431
+ "learning_rate": 2.44559585492228e-06,
1432
+ "entropy": 0.8381482209177921,
1433
+ "num_tokens": 48952457.0,
1434
+ "logits/chosen": -1.4216991849843164,
1435
+ "logits/rejected": -1.1461203116135463,
1436
+ "mean_token_accuracy": 0.7074375116080046,
1437
+ "rewards/chosen": -0.6695640615803495,
1438
+ "rewards/rejected": -2.0397114378174592,
1439
+ "rewards/accuracies": 0.81125,
1440
+ "rewards/margins": 1.3701473774015904,
1441
+ "logps/chosen": -58.40614979505539,
1442
+ "logps/rejected": -75.83607840061188,
1443
+ "epoch": 0.7572221357813391,
1444
+ "step": 730
1445
+ },
1446
+ {
1447
+ "loss": 0.42221574783325194,
1448
+ "grad_norm": 0.016754452139139175,
1449
+ "learning_rate": 2.3419689119170984e-06,
1450
+ "entropy": 0.8271626771151205,
1451
+ "num_tokens": 49623039.0,
1452
+ "logits/chosen": -1.5209721524713908,
1453
+ "logits/rejected": -1.1751758197782376,
1454
+ "mean_token_accuracy": 0.713498560115695,
1455
+ "rewards/chosen": -0.693279623198905,
1456
+ "rewards/rejected": -2.141712246098032,
1457
+ "rewards/accuracies": 0.8225,
1458
+ "rewards/margins": 1.448432622421533,
1459
+ "logps/chosen": -58.120414593219756,
1460
+ "logps/rejected": -76.37068503379822,
1461
+ "epoch": 0.7675950417509465,
1462
+ "step": 740
1463
+ },
1464
+ {
1465
+ "loss": 0.42609853744506837,
1466
+ "grad_norm": 0.015460499562323093,
1467
+ "learning_rate": 2.2383419689119174e-06,
1468
+ "entropy": 0.8402992183688912,
1469
+ "num_tokens": 50296449.0,
1470
+ "logits/chosen": -1.4753382490797897,
1471
+ "logits/rejected": -1.1819095770610415,
1472
+ "mean_token_accuracy": 0.7086446931585669,
1473
+ "rewards/chosen": -0.756505029114196,
1474
+ "rewards/rejected": -2.2547341962716017,
1475
+ "rewards/accuracies": 0.815,
1476
+ "rewards/margins": 1.4982291649701074,
1477
+ "logps/chosen": -61.22059069037437,
1478
+ "logps/rejected": -78.80186176776886,
1479
+ "epoch": 0.7779679477205539,
1480
+ "step": 750
1481
+ },
1482
+ {
1483
+ "eval_loss": 0.411579966545105,
1484
+ "eval_runtime": 345.2282,
1485
+ "eval_samples_per_second": 2.897,
1486
+ "eval_steps_per_second": 2.897,
1487
+ "eval_entropy": 0.7931306820721366,
1488
+ "eval_num_tokens": 50296449.0,
1489
+ "eval_logits/chosen": -1.5620700320679246,
1490
+ "eval_logits/rejected": -1.2442960317998197,
1491
+ "eval_mean_token_accuracy": 0.7116911947578192,
1492
+ "eval_rewards/chosen": -0.7726080814675516,
1493
+ "eval_rewards/rejected": -2.2532580847712236,
1494
+ "eval_rewards/accuracies": 0.825,
1495
+ "eval_rewards/margins": 1.4806500013172625,
1496
+ "eval_logps/chosen": -57.89906752586365,
1497
+ "eval_logps/rejected": -75.1724522151947,
1498
+ "epoch": 0.7779679477205539,
1499
+ "step": 750
1500
+ },
1501
+ {
1502
+ "loss": 0.3913722515106201,
1503
+ "grad_norm": 0.014632239006459713,
1504
+ "learning_rate": 2.134715025906736e-06,
1505
+ "entropy": 0.8136140358856937,
1506
+ "num_tokens": 50967491.0,
1507
+ "logits/chosen": -1.562353067996462,
1508
+ "logits/rejected": -1.2513613833271493,
1509
+ "mean_token_accuracy": 0.7093207446113229,
1510
+ "rewards/chosen": -0.7712609519985927,
1511
+ "rewards/rejected": -2.253486830406473,
1512
+ "rewards/accuracies": 0.84375,
1513
+ "rewards/margins": 1.4822258768649772,
1514
+ "logps/chosen": -59.60826306819916,
1515
+ "logps/rejected": -76.35254566431045,
1516
+ "epoch": 0.7883408536901613,
1517
+ "step": 760
1518
+ },
1519
+ {
1520
+ "loss": 0.40571393966674807,
1521
+ "grad_norm": 0.025566810742020607,
1522
+ "learning_rate": 2.0310880829015544e-06,
1523
+ "entropy": 0.8285544535657391,
1524
+ "num_tokens": 51641328.0,
1525
+ "logits/chosen": -1.522793583175992,
1526
+ "logits/rejected": -1.1822050205320058,
1527
+ "mean_token_accuracy": 0.7068053354136645,
1528
+ "rewards/chosen": -0.7923616364665214,
1529
+ "rewards/rejected": -2.37010533751054,
1530
+ "rewards/accuracies": 0.81375,
1531
+ "rewards/margins": 1.5777437023073435,
1532
+ "logps/chosen": -61.9151118016243,
1533
+ "logps/rejected": -79.94920246601104,
1534
+ "epoch": 0.7987137596597687,
1535
+ "step": 770
1536
+ },
1537
+ {
1538
+ "loss": 0.4391521453857422,
1539
+ "grad_norm": 0.016789298504590988,
1540
+ "learning_rate": 1.9274611398963734e-06,
1541
+ "entropy": 0.7836550371508929,
1542
+ "num_tokens": 52311665.0,
1543
+ "logits/chosen": -1.6191126859645035,
1544
+ "logits/rejected": -1.29179419660706,
1545
+ "mean_token_accuracy": 0.7130378339067102,
1546
+ "rewards/chosen": -0.8251502061705105,
1547
+ "rewards/rejected": -2.330989454947412,
1548
+ "rewards/accuracies": 0.81375,
1549
+ "rewards/margins": 1.5058392491098493,
1550
+ "logps/chosen": -58.14819228887558,
1551
+ "logps/rejected": -76.84343997001648,
1552
+ "epoch": 0.809086665629376,
1553
+ "step": 780
1554
+ },
1555
+ {
1556
+ "loss": 0.4155034065246582,
1557
+ "grad_norm": 0.015209637582302094,
1558
+ "learning_rate": 1.823834196891192e-06,
1559
+ "entropy": 0.816227734730055,
1560
+ "num_tokens": 52982847.0,
1561
+ "logits/chosen": -1.552296107544077,
1562
+ "logits/rejected": -1.2655800747433517,
1563
+ "mean_token_accuracy": 0.7077531234174966,
1564
+ "rewards/chosen": -0.7692844783003966,
1565
+ "rewards/rejected": -2.2729846961359725,
1566
+ "rewards/accuracies": 0.81625,
1567
+ "rewards/margins": 1.5037002183427104,
1568
+ "logps/chosen": -59.88701428174973,
1569
+ "logps/rejected": -75.7218120956421,
1570
+ "epoch": 0.8194595715989834,
1571
+ "step": 790
1572
+ },
1573
+ {
1574
+ "loss": 0.4396702289581299,
1575
+ "grad_norm": 0.017707331106066704,
1576
+ "learning_rate": 1.7202072538860104e-06,
1577
+ "entropy": 0.8157146892453602,
1578
+ "num_tokens": 53653414.0,
1579
+ "logits/chosen": -1.5836949831528315,
1580
+ "logits/rejected": -1.2884593526275128,
1581
+ "mean_token_accuracy": 0.7132340743020177,
1582
+ "rewards/chosen": -0.7823633211505876,
1583
+ "rewards/rejected": -2.2281043492229764,
1584
+ "rewards/accuracies": 0.80375,
1585
+ "rewards/margins": 1.4457410290511326,
1586
+ "logps/chosen": -59.43502898097038,
1587
+ "logps/rejected": -75.63278030633927,
1588
+ "epoch": 0.8298324775685908,
1589
+ "step": 800
1590
+ },
1591
+ {
1592
+ "loss": 0.4166680335998535,
1593
+ "grad_norm": 0.017773514613509178,
1594
+ "learning_rate": 1.6165803108808292e-06,
1595
+ "entropy": 0.797488763818983,
1596
+ "num_tokens": 54324247.0,
1597
+ "logits/chosen": -1.6215031533790736,
1598
+ "logits/rejected": -1.3289979163820846,
1599
+ "mean_token_accuracy": 0.7087218741327524,
1600
+ "rewards/chosen": -0.761779917108106,
1601
+ "rewards/rejected": -2.309470071569667,
1602
+ "rewards/accuracies": 0.81125,
1603
+ "rewards/margins": 1.5476901544816792,
1604
+ "logps/chosen": -58.93250516653061,
1605
+ "logps/rejected": -76.49902043104171,
1606
+ "epoch": 0.8402053835381982,
1607
+ "step": 810
1608
+ },
1609
+ {
1610
+ "loss": 0.4239467144012451,
1611
+ "grad_norm": 0.018757648766040802,
1612
+ "learning_rate": 1.5129533678756477e-06,
1613
+ "entropy": 0.8032379890448647,
1614
+ "num_tokens": 54994016.0,
1615
+ "logits/chosen": -1.578882165777075,
1616
+ "logits/rejected": -1.2860967628921216,
1617
+ "mean_token_accuracy": 0.7140155434235931,
1618
+ "rewards/chosen": -0.7499237745841674,
1619
+ "rewards/rejected": -2.2461700457381086,
1620
+ "rewards/accuracies": 0.82375,
1621
+ "rewards/margins": 1.496246272022836,
1622
+ "logps/chosen": -58.89809783697128,
1623
+ "logps/rejected": -74.08916418790817,
1624
+ "epoch": 0.8505782895078056,
1625
+ "step": 820
1626
+ },
1627
+ {
1628
+ "loss": 0.419736909866333,
1629
+ "grad_norm": 0.018885280936956406,
1630
+ "learning_rate": 1.4093264248704663e-06,
1631
+ "entropy": 0.7875165941729211,
1632
+ "num_tokens": 55663818.0,
1633
+ "logits/chosen": -1.6236698629206843,
1634
+ "logits/rejected": -1.2788538558527598,
1635
+ "mean_token_accuracy": 0.7192669866792858,
1636
+ "rewards/chosen": -0.7543148858308633,
1637
+ "rewards/rejected": -2.269310671926214,
1638
+ "rewards/accuracies": 0.8075,
1639
+ "rewards/margins": 1.5149957838421688,
1640
+ "logps/chosen": -55.762867684364316,
1641
+ "logps/rejected": -76.66288559436798,
1642
+ "epoch": 0.860951195477413,
1643
+ "step": 830
1644
+ },
1645
+ {
1646
+ "loss": 0.4073533058166504,
1647
+ "grad_norm": 0.01915486343204975,
1648
+ "learning_rate": 1.3056994818652852e-06,
1649
+ "entropy": 0.8327871753677027,
1650
+ "num_tokens": 56334476.0,
1651
+ "logits/chosen": -1.4996538615666455,
1652
+ "logits/rejected": -1.237756981594407,
1653
+ "mean_token_accuracy": 0.716468540597707,
1654
+ "rewards/chosen": -0.7192282251862707,
1655
+ "rewards/rejected": -2.26593919366569,
1656
+ "rewards/accuracies": 0.82875,
1657
+ "rewards/margins": 1.5467109655588864,
1658
+ "logps/chosen": -59.84484759330749,
1659
+ "logps/rejected": -76.10131199359894,
1660
+ "epoch": 0.8713241014470204,
1661
+ "step": 840
1662
+ },
1663
+ {
1664
+ "loss": 0.42834720611572263,
1665
+ "grad_norm": 0.01567392610013485,
1666
+ "learning_rate": 1.2020725388601037e-06,
1667
+ "entropy": 0.827671511786757,
1668
+ "num_tokens": 57005010.0,
1669
+ "logits/chosen": -1.5224089619857955,
1670
+ "logits/rejected": -1.203097930514173,
1671
+ "mean_token_accuracy": 0.7094048094563186,
1672
+ "rewards/chosen": -0.8032524040471617,
1673
+ "rewards/rejected": -2.2959909180374236,
1674
+ "rewards/accuracies": 0.8,
1675
+ "rewards/margins": 1.4927385161118583,
1676
+ "logps/chosen": -60.616187605857846,
1677
+ "logps/rejected": -76.86470454216004,
1678
+ "epoch": 0.8816970074166278,
1679
+ "step": 850
1680
+ },
1681
+ {
1682
+ "loss": 0.4034994602203369,
1683
+ "grad_norm": 0.014525278471410275,
1684
+ "learning_rate": 1.0984455958549225e-06,
1685
+ "entropy": 0.818393541239202,
1686
+ "num_tokens": 57677536.0,
1687
+ "logits/chosen": -1.543480139299166,
1688
+ "logits/rejected": -1.2204454822419504,
1689
+ "mean_token_accuracy": 0.7158707704581321,
1690
+ "rewards/chosen": -0.7887829605976913,
1691
+ "rewards/rejected": -2.3561961521262127,
1692
+ "rewards/accuracies": 0.82125,
1693
+ "rewards/margins": 1.5674131939606741,
1694
+ "logps/chosen": -60.70202103614807,
1695
+ "logps/rejected": -77.77336375951766,
1696
+ "epoch": 0.8920699133862352,
1697
+ "step": 860
1698
+ },
1699
+ {
1700
+ "loss": 0.432753324508667,
1701
+ "grad_norm": 0.02228359691798687,
1702
+ "learning_rate": 9.94818652849741e-07,
1703
+ "entropy": 0.8074402804669808,
1704
+ "num_tokens": 58349497.0,
1705
+ "logits/chosen": -1.558037182784836,
1706
+ "logits/rejected": -1.2543498522866354,
1707
+ "mean_token_accuracy": 0.703925465606153,
1708
+ "rewards/chosen": -0.805554041202995,
1709
+ "rewards/rejected": -2.2746161510888485,
1710
+ "rewards/accuracies": 0.835,
1711
+ "rewards/margins": 1.4690621069492773,
1712
+ "logps/chosen": -62.29052616596222,
1713
+ "logps/rejected": -75.3348803281784,
1714
+ "epoch": 0.9024428193558426,
1715
+ "step": 870
1716
+ },
1717
+ {
1718
+ "eval_loss": 0.4090946316719055,
1719
+ "eval_runtime": 375.2006,
1720
+ "eval_samples_per_second": 2.665,
1721
+ "eval_steps_per_second": 2.665,
1722
+ "eval_entropy": 0.7924561413838528,
1723
+ "eval_num_tokens": 58685036.0,
1724
+ "eval_logits/chosen": -1.5811667035215011,
1725
+ "eval_logits/rejected": -1.2610527832956517,
1726
+ "eval_mean_token_accuracy": 0.7133496539741755,
1727
+ "eval_rewards/chosen": -0.7897945828609518,
1728
+ "eval_rewards/rejected": -2.3197074431839866,
1729
+ "eval_rewards/accuracies": 0.828,
1730
+ "eval_rewards/margins": 1.5299128606393932,
1731
+ "eval_logps/chosen": -58.07093252563477,
1732
+ "eval_logps/rejected": -75.83694574356079,
1733
+ "epoch": 0.9076292723406463,
1734
+ "step": 875
1735
+ },
1736
+ {
1737
+ "loss": 0.39424493312835696,
1738
+ "grad_norm": 0.013235539197921753,
1739
+ "learning_rate": 8.911917098445596e-07,
1740
+ "entropy": 0.7996839477901813,
1741
+ "num_tokens": 59020756.0,
1742
+ "logits/chosen": -1.5843618404439912,
1743
+ "logits/rejected": -1.2211371427803261,
1744
+ "mean_token_accuracy": 0.7160469963587821,
1745
+ "rewards/chosen": -0.7639252483138261,
1746
+ "rewards/rejected": -2.3575840306148166,
1747
+ "rewards/accuracies": 0.82625,
1748
+ "rewards/margins": 1.5936587833426892,
1749
+ "logps/chosen": -57.04736487388611,
1750
+ "logps/rejected": -79.49960944414138,
1751
+ "epoch": 0.91281572532545,
1752
+ "step": 880
1753
+ },
1754
+ {
1755
+ "loss": 0.4502077102661133,
1756
+ "grad_norm": 0.016691625118255615,
1757
+ "learning_rate": 7.875647668393784e-07,
1758
+ "entropy": 0.7824898976105032,
1759
+ "num_tokens": 59691542.0,
1760
+ "logits/chosen": -1.6007244896342394,
1761
+ "logits/rejected": -1.2807950876104501,
1762
+ "mean_token_accuracy": 0.7142804705537855,
1763
+ "rewards/chosen": -0.8533335844849352,
1764
+ "rewards/rejected": -2.263447732278146,
1765
+ "rewards/accuracies": 0.80875,
1766
+ "rewards/margins": 1.4101141486410051,
1767
+ "logps/chosen": -58.45585764169693,
1768
+ "logps/rejected": -76.72949911355973,
1769
+ "epoch": 0.9231886312950573,
1770
+ "step": 890
1771
+ },
1772
+ {
1773
+ "loss": 0.40724778175354004,
1774
+ "grad_norm": 0.019250568002462387,
1775
+ "learning_rate": 6.839378238341969e-07,
1776
+ "entropy": 0.819874558126321,
1777
+ "num_tokens": 60363238.0,
1778
+ "logits/chosen": -1.5555056418182593,
1779
+ "logits/rejected": -1.2092615978992753,
1780
+ "mean_token_accuracy": 0.7146024034544826,
1781
+ "rewards/chosen": -0.8092134252478718,
1782
+ "rewards/rejected": -2.3746094698365776,
1783
+ "rewards/accuracies": 0.8225,
1784
+ "rewards/margins": 1.565396042652428,
1785
+ "logps/chosen": -58.4417240858078,
1786
+ "logps/rejected": -80.7738204741478,
1787
+ "epoch": 0.9335615372646647,
1788
+ "step": 900
1789
+ },
1790
+ {
1791
+ "loss": 0.4182878971099854,
1792
+ "grad_norm": 0.02170160599052906,
1793
+ "learning_rate": 5.803108808290156e-07,
1794
+ "entropy": 0.8145798404130619,
1795
+ "num_tokens": 61034470.0,
1796
+ "logits/chosen": -1.5395043610571841,
1797
+ "logits/rejected": -1.2172720667091816,
1798
+ "mean_token_accuracy": 0.7149157860130072,
1799
+ "rewards/chosen": -0.8415973563533043,
1800
+ "rewards/rejected": -2.4253665239037945,
1801
+ "rewards/accuracies": 0.81,
1802
+ "rewards/margins": 1.5837691660691053,
1803
+ "logps/chosen": -58.98787801384926,
1804
+ "logps/rejected": -78.09846720218658,
1805
+ "epoch": 0.9439344432342721,
1806
+ "step": 910
1807
+ },
1808
+ {
1809
+ "loss": 0.42937483787536623,
1810
+ "grad_norm": 0.014422536827623844,
1811
+ "learning_rate": 4.7668393782383424e-07,
1812
+ "entropy": 0.7941974463209044,
1813
+ "num_tokens": 61703303.0,
1814
+ "logits/chosen": -1.5714764751371695,
1815
+ "logits/rejected": -1.2391417194541616,
1816
+ "mean_token_accuracy": 0.7113890647143125,
1817
+ "rewards/chosen": -0.8099557375663425,
1818
+ "rewards/rejected": -2.294640830200858,
1819
+ "rewards/accuracies": 0.81125,
1820
+ "rewards/margins": 1.4846850905031896,
1821
+ "logps/chosen": -56.28238318800926,
1822
+ "logps/rejected": -74.58795207023621,
1823
+ "epoch": 0.9543073492038795,
1824
+ "step": 920
1825
+ },
1826
+ {
1827
+ "loss": 0.40997958183288574,
1828
+ "grad_norm": 0.02402566932141781,
1829
+ "learning_rate": 3.730569948186528e-07,
1830
+ "entropy": 0.8154971726459916,
1831
+ "num_tokens": 62375816.0,
1832
+ "logits/chosen": -1.545892127215608,
1833
+ "logits/rejected": -1.2600055196671498,
1834
+ "mean_token_accuracy": 0.704818404596299,
1835
+ "rewards/chosen": -0.7739588160630956,
1836
+ "rewards/rejected": -2.308201268577832,
1837
+ "rewards/accuracies": 0.8175,
1838
+ "rewards/margins": 1.5342424516985194,
1839
+ "logps/chosen": -60.89072738647461,
1840
+ "logps/rejected": -77.38187520503998,
1841
+ "epoch": 0.9646802551734869,
1842
+ "step": 930
1843
+ },
1844
+ {
1845
+ "loss": 0.4273488998413086,
1846
+ "grad_norm": 0.016814034432172775,
1847
+ "learning_rate": 2.694300518134715e-07,
1848
+ "entropy": 0.81020716742496,
1849
+ "num_tokens": 63047673.0,
1850
+ "logits/chosen": -1.5172310235884794,
1851
+ "logits/rejected": -1.1998523520459965,
1852
+ "mean_token_accuracy": 0.7050479584932328,
1853
+ "rewards/chosen": -0.8097914783160922,
1854
+ "rewards/rejected": -2.262013399923744,
1855
+ "rewards/accuracies": 0.80625,
1856
+ "rewards/margins": 1.452221922907047,
1857
+ "logps/chosen": -60.9624414229393,
1858
+ "logps/rejected": -75.92849832773209,
1859
+ "epoch": 0.9750531611430943,
1860
+ "step": 940
1861
+ },
1862
+ {
1863
+ "loss": 0.4405078411102295,
1864
+ "grad_norm": 0.02221529930830002,
1865
+ "learning_rate": 1.6580310880829015e-07,
1866
+ "entropy": 0.7960373500641436,
1867
+ "num_tokens": 63718529.0,
1868
+ "logits/chosen": -1.5261262470344286,
1869
+ "logits/rejected": -1.2351896031266807,
1870
+ "mean_token_accuracy": 0.7166906687803567,
1871
+ "rewards/chosen": -0.8054070144893921,
1872
+ "rewards/rejected": -2.2143535910593344,
1873
+ "rewards/accuracies": 0.79875,
1874
+ "rewards/margins": 1.4089465801790357,
1875
+ "logps/chosen": -58.76033858776093,
1876
+ "logps/rejected": -75.32699841499328,
1877
+ "epoch": 0.9854260671127016,
1878
+ "step": 950
1879
+ },
1880
+ {
1881
+ "loss": 0.4032235622406006,
1882
+ "grad_norm": 0.015166543424129486,
1883
+ "learning_rate": 6.217616580310881e-08,
1884
+ "entropy": 0.8253091154253344,
1885
+ "num_tokens": 64391541.0,
1886
+ "logits/chosen": -1.5054467577713744,
1887
+ "logits/rejected": -1.1940948964954847,
1888
+ "mean_token_accuracy": 0.7102081939950585,
1889
+ "rewards/chosen": -0.7573958630473498,
1890
+ "rewards/rejected": -2.3041888994569306,
1891
+ "rewards/accuracies": 0.8125,
1892
+ "rewards/margins": 1.5467930364748463,
1893
+ "logps/chosen": -59.873460137844084,
1894
+ "logps/rejected": -77.67126994132995,
1895
+ "epoch": 0.995798973082309,
1896
+ "step": 960
1897
+ },
1898
+ {
1899
+ "train_runtime": 36967.0361,
1900
+ "train_samples_per_second": 2.086,
1901
+ "train_steps_per_second": 0.026,
1902
+ "total_flos": 5.2405488888805786e+17,
1903
+ "train_loss": 0.453640728787437,
1904
+ "entropy": 0.8554125972153952,
1905
+ "num_tokens": 64664162.0,
1906
+ "logits/chosen": -1.3863200845494572,
1907
+ "logits/rejected": -1.1139205918868142,
1908
+ "mean_token_accuracy": 0.7043190732322357,
1909
+ "rewards/chosen": -0.8579825216625461,
1910
+ "rewards/rejected": -2.1552414747104507,
1911
+ "rewards/accuracies": 0.7932098765432098,
1912
+ "rewards/margins": 1.2972589509883596,
1913
+ "logps/chosen": -62.61760814690295,
1914
+ "logps/rejected": -79.34557756376856,
1915
+ "epoch": 1.0,
1916
+ "step": 965
1917
+ }
1918
+ ],
1919
+ "validation_monitor_size": 1000,
1920
+ "validation_monitor_selection": "fixed_seed_random_without_replacement",
1921
+ "validation_monitor_seed": 22,
1922
+ "validation_monitor_indices": [
1923
+ 2,
1924
+ 10,
1925
+ 14,
1926
+ 21,
1927
+ 55,
1928
+ 63,
1929
+ 66,
1930
+ 69,
1931
+ 107,
1932
+ 110,
1933
+ 142,
1934
+ 144,
1935
+ 149,
1936
+ 150,
1937
+ 151,
1938
+ 152,
1939
+ 160,
1940
+ 163,
1941
+ 166,
1942
+ 167,
1943
+ 176,
1944
+ 181,
1945
+ 206,
1946
+ 207,
1947
+ 259,
1948
+ 267,
1949
+ 281,
1950
+ 295,
1951
+ 298,
1952
+ 306,
1953
+ 307,
1954
+ 317,
1955
+ 321,
1956
+ 331,
1957
+ 336,
1958
+ 341,
1959
+ 346,
1960
+ 349,
1961
+ 351,
1962
+ 352,
1963
+ 357,
1964
+ 358,
1965
+ 369,
1966
+ 370,
1967
+ 382,
1968
+ 386,
1969
+ 391,
1970
+ 401,
1971
+ 411,
1972
+ 412,
1973
+ 432,
1974
+ 437,
1975
+ 452,
1976
+ 462,
1977
+ 465,
1978
+ 488,
1979
+ 490,
1980
+ 491,
1981
+ 492,
1982
+ 494,
1983
+ 503,
1984
+ 504,
1985
+ 508,
1986
+ 528,
1987
+ 538,
1988
+ 540,
1989
+ 551,
1990
+ 553,
1991
+ 567,
1992
+ 586,
1993
+ 605,
1994
+ 606,
1995
+ 625,
1996
+ 627,
1997
+ 661,
1998
+ 663,
1999
+ 666,
2000
+ 677,
2001
+ 685,
2002
+ 690,
2003
+ 692,
2004
+ 704,
2005
+ 708,
2006
+ 714,
2007
+ 715,
2008
+ 727,
2009
+ 728,
2010
+ 733,
2011
+ 745,
2012
+ 752,
2013
+ 753,
2014
+ 755,
2015
+ 764,
2016
+ 773,
2017
+ 779,
2018
+ 783,
2019
+ 793,
2020
+ 796,
2021
+ 799,
2022
+ 803,
2023
+ 804,
2024
+ 805,
2025
+ 813,
2026
+ 816,
2027
+ 818,
2028
+ 823,
2029
+ 827,
2030
+ 829,
2031
+ 830,
2032
+ 837,
2033
+ 842,
2034
+ 845,
2035
+ 850,
2036
+ 853,
2037
+ 856,
2038
+ 889,
2039
+ 890,
2040
+ 905,
2041
+ 915,
2042
+ 924,
2043
+ 930,
2044
+ 939,
2045
+ 951,
2046
+ 988,
2047
+ 1002,
2048
+ 1005,
2049
+ 1023,
2050
+ 1029,
2051
+ 1038,
2052
+ 1049,
2053
+ 1050,
2054
+ 1054,
2055
+ 1056,
2056
+ 1067,
2057
+ 1068,
2058
+ 1079,
2059
+ 1088,
2060
+ 1091,
2061
+ 1103,
2062
+ 1114,
2063
+ 1118,
2064
+ 1133,
2065
+ 1140,
2066
+ 1144,
2067
+ 1145,
2068
+ 1155,
2069
+ 1186,
2070
+ 1195,
2071
+ 1206,
2072
+ 1223,
2073
+ 1251,
2074
+ 1252,
2075
+ 1257,
2076
+ 1259,
2077
+ 1270,
2078
+ 1271,
2079
+ 1295,
2080
+ 1303,
2081
+ 1304,
2082
+ 1305,
2083
+ 1329,
2084
+ 1335,
2085
+ 1336,
2086
+ 1343,
2087
+ 1367,
2088
+ 1373,
2089
+ 1377,
2090
+ 1403,
2091
+ 1412,
2092
+ 1429,
2093
+ 1443,
2094
+ 1457,
2095
+ 1459,
2096
+ 1460,
2097
+ 1476,
2098
+ 1483,
2099
+ 1486,
2100
+ 1494,
2101
+ 1507,
2102
+ 1510,
2103
+ 1519,
2104
+ 1521,
2105
+ 1522,
2106
+ 1545,
2107
+ 1551,
2108
+ 1570,
2109
+ 1582,
2110
+ 1593,
2111
+ 1595,
2112
+ 1603,
2113
+ 1607,
2114
+ 1614,
2115
+ 1615,
2116
+ 1625,
2117
+ 1634,
2118
+ 1639,
2119
+ 1648,
2120
+ 1654,
2121
+ 1657,
2122
+ 1662,
2123
+ 1667,
2124
+ 1673,
2125
+ 1690,
2126
+ 1704,
2127
+ 1746,
2128
+ 1756,
2129
+ 1781,
2130
+ 1783,
2131
+ 1796,
2132
+ 1799,
2133
+ 1809,
2134
+ 1814,
2135
+ 1827,
2136
+ 1829,
2137
+ 1832,
2138
+ 1844,
2139
+ 1847,
2140
+ 1854,
2141
+ 1856,
2142
+ 1857,
2143
+ 1858,
2144
+ 1874,
2145
+ 1883,
2146
+ 1889,
2147
+ 1924,
2148
+ 1925,
2149
+ 1931,
2150
+ 1932,
2151
+ 1934,
2152
+ 1935,
2153
+ 1938,
2154
+ 1950,
2155
+ 1957,
2156
+ 1962,
2157
+ 1967,
2158
+ 1975,
2159
+ 1982,
2160
+ 1983,
2161
+ 1991,
2162
+ 1998,
2163
+ 2003,
2164
+ 2008,
2165
+ 2017,
2166
+ 2021,
2167
+ 2026,
2168
+ 2035,
2169
+ 2040,
2170
+ 2050,
2171
+ 2056,
2172
+ 2077,
2173
+ 2079,
2174
+ 2082,
2175
+ 2098,
2176
+ 2100,
2177
+ 2108,
2178
+ 2121,
2179
+ 2130,
2180
+ 2133,
2181
+ 2134,
2182
+ 2138,
2183
+ 2143,
2184
+ 2166,
2185
+ 2167,
2186
+ 2180,
2187
+ 2181,
2188
+ 2185,
2189
+ 2204,
2190
+ 2205,
2191
+ 2212,
2192
+ 2221,
2193
+ 2224,
2194
+ 2226,
2195
+ 2230,
2196
+ 2233,
2197
+ 2256,
2198
+ 2261,
2199
+ 2263,
2200
+ 2269,
2201
+ 2273,
2202
+ 2290,
2203
+ 2291,
2204
+ 2299,
2205
+ 2301,
2206
+ 2321,
2207
+ 2323,
2208
+ 2330,
2209
+ 2384,
2210
+ 2401,
2211
+ 2417,
2212
+ 2420,
2213
+ 2421,
2214
+ 2424,
2215
+ 2430,
2216
+ 2435,
2217
+ 2456,
2218
+ 2488,
2219
+ 2502,
2220
+ 2504,
2221
+ 2519,
2222
+ 2527,
2223
+ 2532,
2224
+ 2538,
2225
+ 2542,
2226
+ 2553,
2227
+ 2555,
2228
+ 2558,
2229
+ 2559,
2230
+ 2562,
2231
+ 2578,
2232
+ 2583,
2233
+ 2585,
2234
+ 2590,
2235
+ 2592,
2236
+ 2594,
2237
+ 2596,
2238
+ 2600,
2239
+ 2606,
2240
+ 2607,
2241
+ 2618,
2242
+ 2630,
2243
+ 2637,
2244
+ 2647,
2245
+ 2650,
2246
+ 2657,
2247
+ 2679,
2248
+ 2685,
2249
+ 2705,
2250
+ 2706,
2251
+ 2712,
2252
+ 2713,
2253
+ 2714,
2254
+ 2727,
2255
+ 2740,
2256
+ 2742,
2257
+ 2755,
2258
+ 2780,
2259
+ 2784,
2260
+ 2792,
2261
+ 2807,
2262
+ 2808,
2263
+ 2810,
2264
+ 2820,
2265
+ 2831,
2266
+ 2839,
2267
+ 2860,
2268
+ 2862,
2269
+ 2863,
2270
+ 2866,
2271
+ 2875,
2272
+ 2878,
2273
+ 2898,
2274
+ 2905,
2275
+ 2921,
2276
+ 2922,
2277
+ 2926,
2278
+ 2930,
2279
+ 2934,
2280
+ 2944,
2281
+ 2955,
2282
+ 2957,
2283
+ 2959,
2284
+ 2973,
2285
+ 2978,
2286
+ 2998,
2287
+ 3018,
2288
+ 3022,
2289
+ 3028,
2290
+ 3031,
2291
+ 3061,
2292
+ 3085,
2293
+ 3090,
2294
+ 3104,
2295
+ 3105,
2296
+ 3111,
2297
+ 3115,
2298
+ 3121,
2299
+ 3122,
2300
+ 3129,
2301
+ 3133,
2302
+ 3135,
2303
+ 3161,
2304
+ 3162,
2305
+ 3169,
2306
+ 3173,
2307
+ 3194,
2308
+ 3195,
2309
+ 3215,
2310
+ 3225,
2311
+ 3226,
2312
+ 3241,
2313
+ 3247,
2314
+ 3250,
2315
+ 3253,
2316
+ 3265,
2317
+ 3268,
2318
+ 3293,
2319
+ 3301,
2320
+ 3312,
2321
+ 3329,
2322
+ 3352,
2323
+ 3361,
2324
+ 3362,
2325
+ 3376,
2326
+ 3396,
2327
+ 3401,
2328
+ 3403,
2329
+ 3410,
2330
+ 3419,
2331
+ 3432,
2332
+ 3443,
2333
+ 3452,
2334
+ 3467,
2335
+ 3469,
2336
+ 3475,
2337
+ 3485,
2338
+ 3503,
2339
+ 3514,
2340
+ 3515,
2341
+ 3524,
2342
+ 3528,
2343
+ 3538,
2344
+ 3544,
2345
+ 3557,
2346
+ 3560,
2347
+ 3565,
2348
+ 3600,
2349
+ 3637,
2350
+ 3642,
2351
+ 3658,
2352
+ 3659,
2353
+ 3692,
2354
+ 3693,
2355
+ 3699,
2356
+ 3722,
2357
+ 3725,
2358
+ 3728,
2359
+ 3731,
2360
+ 3740,
2361
+ 3742,
2362
+ 3762,
2363
+ 3766,
2364
+ 3780,
2365
+ 3788,
2366
+ 3794,
2367
+ 3796,
2368
+ 3798,
2369
+ 3805,
2370
+ 3817,
2371
+ 3819,
2372
+ 3822,
2373
+ 3837,
2374
+ 3839,
2375
+ 3843,
2376
+ 3846,
2377
+ 3851,
2378
+ 3854,
2379
+ 3865,
2380
+ 3870,
2381
+ 3871,
2382
+ 3884,
2383
+ 3894,
2384
+ 3895,
2385
+ 3896,
2386
+ 3907,
2387
+ 3911,
2388
+ 3915,
2389
+ 3919,
2390
+ 3920,
2391
+ 3923,
2392
+ 3933,
2393
+ 3955,
2394
+ 3967,
2395
+ 3972,
2396
+ 3974,
2397
+ 3975,
2398
+ 3984,
2399
+ 3985,
2400
+ 3997,
2401
+ 4002,
2402
+ 4010,
2403
+ 4034,
2404
+ 4044,
2405
+ 4063,
2406
+ 4073,
2407
+ 4079,
2408
+ 4082,
2409
+ 4088,
2410
+ 4121,
2411
+ 4145,
2412
+ 4148,
2413
+ 4159,
2414
+ 4161,
2415
+ 4164,
2416
+ 4177,
2417
+ 4188,
2418
+ 4199,
2419
+ 4203,
2420
+ 4207,
2421
+ 4208,
2422
+ 4213,
2423
+ 4221,
2424
+ 4225,
2425
+ 4233,
2426
+ 4241,
2427
+ 4243,
2428
+ 4247,
2429
+ 4264,
2430
+ 4274,
2431
+ 4282,
2432
+ 4286,
2433
+ 4290,
2434
+ 4308,
2435
+ 4310,
2436
+ 4313,
2437
+ 4321,
2438
+ 4324,
2439
+ 4327,
2440
+ 4349,
2441
+ 4362,
2442
+ 4370,
2443
+ 4374,
2444
+ 4380,
2445
+ 4407,
2446
+ 4409,
2447
+ 4411,
2448
+ 4415,
2449
+ 4417,
2450
+ 4418,
2451
+ 4427,
2452
+ 4431,
2453
+ 4433,
2454
+ 4451,
2455
+ 4466,
2456
+ 4477,
2457
+ 4478,
2458
+ 4479,
2459
+ 4493,
2460
+ 4494,
2461
+ 4514,
2462
+ 4527,
2463
+ 4539,
2464
+ 4550,
2465
+ 4558,
2466
+ 4568,
2467
+ 4579,
2468
+ 4583,
2469
+ 4584,
2470
+ 4586,
2471
+ 4587,
2472
+ 4590,
2473
+ 4599,
2474
+ 4602,
2475
+ 4610,
2476
+ 4626,
2477
+ 4627,
2478
+ 4630,
2479
+ 4641,
2480
+ 4647,
2481
+ 4655,
2482
+ 4656,
2483
+ 4657,
2484
+ 4661,
2485
+ 4685,
2486
+ 4714,
2487
+ 4715,
2488
+ 4731,
2489
+ 4749,
2490
+ 4752,
2491
+ 4769,
2492
+ 4777,
2493
+ 4782,
2494
+ 4791,
2495
+ 4805,
2496
+ 4818,
2497
+ 4829,
2498
+ 4833,
2499
+ 4837,
2500
+ 4839,
2501
+ 4843,
2502
+ 4871,
2503
+ 4875,
2504
+ 4879,
2505
+ 4880,
2506
+ 4885,
2507
+ 4888,
2508
+ 4895,
2509
+ 4900,
2510
+ 4923,
2511
+ 4966,
2512
+ 4968,
2513
+ 4972,
2514
+ 4989,
2515
+ 4994,
2516
+ 4998,
2517
+ 5001,
2518
+ 5013,
2519
+ 5019,
2520
+ 5026,
2521
+ 5032,
2522
+ 5034,
2523
+ 5046,
2524
+ 5055,
2525
+ 5085,
2526
+ 5086,
2527
+ 5088,
2528
+ 5089,
2529
+ 5090,
2530
+ 5095,
2531
+ 5108,
2532
+ 5110,
2533
+ 5119,
2534
+ 5120,
2535
+ 5121,
2536
+ 5133,
2537
+ 5148,
2538
+ 5154,
2539
+ 5160,
2540
+ 5169,
2541
+ 5178,
2542
+ 5222,
2543
+ 5223,
2544
+ 5232,
2545
+ 5233,
2546
+ 5240,
2547
+ 5256,
2548
+ 5259,
2549
+ 5264,
2550
+ 5271,
2551
+ 5276,
2552
+ 5279,
2553
+ 5294,
2554
+ 5300,
2555
+ 5303,
2556
+ 5321,
2557
+ 5335,
2558
+ 5337,
2559
+ 5345,
2560
+ 5348,
2561
+ 5365,
2562
+ 5373,
2563
+ 5378,
2564
+ 5384,
2565
+ 5422,
2566
+ 5442,
2567
+ 5443,
2568
+ 5445,
2569
+ 5477,
2570
+ 5485,
2571
+ 5495,
2572
+ 5497,
2573
+ 5504,
2574
+ 5526,
2575
+ 5533,
2576
+ 5542,
2577
+ 5564,
2578
+ 5570,
2579
+ 5579,
2580
+ 5587,
2581
+ 5592,
2582
+ 5608,
2583
+ 5610,
2584
+ 5624,
2585
+ 5630,
2586
+ 5638,
2587
+ 5651,
2588
+ 5663,
2589
+ 5670,
2590
+ 5675,
2591
+ 5691,
2592
+ 5700,
2593
+ 5706,
2594
+ 5707,
2595
+ 5715,
2596
+ 5720,
2597
+ 5721,
2598
+ 5722,
2599
+ 5732,
2600
+ 5738,
2601
+ 5741,
2602
+ 5769,
2603
+ 5771,
2604
+ 5775,
2605
+ 5795,
2606
+ 5796,
2607
+ 5800,
2608
+ 5809,
2609
+ 5810,
2610
+ 5815,
2611
+ 5819,
2612
+ 5827,
2613
+ 5848,
2614
+ 5849,
2615
+ 5852,
2616
+ 5859,
2617
+ 5880,
2618
+ 5884,
2619
+ 5907,
2620
+ 5909,
2621
+ 5912,
2622
+ 5919,
2623
+ 5931,
2624
+ 5932,
2625
+ 5934,
2626
+ 5941,
2627
+ 5948,
2628
+ 5950,
2629
+ 5952,
2630
+ 5953,
2631
+ 5969,
2632
+ 5981,
2633
+ 6000,
2634
+ 6003,
2635
+ 6010,
2636
+ 6018,
2637
+ 6041,
2638
+ 6065,
2639
+ 6075,
2640
+ 6090,
2641
+ 6103,
2642
+ 6106,
2643
+ 6109,
2644
+ 6114,
2645
+ 6123,
2646
+ 6131,
2647
+ 6136,
2648
+ 6138,
2649
+ 6139,
2650
+ 6164,
2651
+ 6165,
2652
+ 6171,
2653
+ 6173,
2654
+ 6180,
2655
+ 6185,
2656
+ 6189,
2657
+ 6190,
2658
+ 6221,
2659
+ 6223,
2660
+ 6237,
2661
+ 6255,
2662
+ 6262,
2663
+ 6265,
2664
+ 6293,
2665
+ 6296,
2666
+ 6305,
2667
+ 6318,
2668
+ 6331,
2669
+ 6336,
2670
+ 6340,
2671
+ 6355,
2672
+ 6366,
2673
+ 6371,
2674
+ 6396,
2675
+ 6399,
2676
+ 6402,
2677
+ 6408,
2678
+ 6432,
2679
+ 6433,
2680
+ 6441,
2681
+ 6456,
2682
+ 6465,
2683
+ 6478,
2684
+ 6486,
2685
+ 6489,
2686
+ 6507,
2687
+ 6508,
2688
+ 6520,
2689
+ 6522,
2690
+ 6528,
2691
+ 6537,
2692
+ 6551,
2693
+ 6564,
2694
+ 6589,
2695
+ 6590,
2696
+ 6598,
2697
+ 6599,
2698
+ 6611,
2699
+ 6613,
2700
+ 6615,
2701
+ 6621,
2702
+ 6634,
2703
+ 6647,
2704
+ 6649,
2705
+ 6654,
2706
+ 6676,
2707
+ 6680,
2708
+ 6690,
2709
+ 6708,
2710
+ 6729,
2711
+ 6736,
2712
+ 6744,
2713
+ 6749,
2714
+ 6756,
2715
+ 6761,
2716
+ 6763,
2717
+ 6773,
2718
+ 6788,
2719
+ 6790,
2720
+ 6796,
2721
+ 6797,
2722
+ 6811,
2723
+ 6824,
2724
+ 6850,
2725
+ 6869,
2726
+ 6871,
2727
+ 6882,
2728
+ 6892,
2729
+ 6895,
2730
+ 6906,
2731
+ 6911,
2732
+ 6912,
2733
+ 6914,
2734
+ 6927,
2735
+ 6952,
2736
+ 6966,
2737
+ 6985,
2738
+ 7001,
2739
+ 7021,
2740
+ 7031,
2741
+ 7035,
2742
+ 7038,
2743
+ 7041,
2744
+ 7045,
2745
+ 7052,
2746
+ 7057,
2747
+ 7058,
2748
+ 7072,
2749
+ 7073,
2750
+ 7076,
2751
+ 7086,
2752
+ 7102,
2753
+ 7107,
2754
+ 7109,
2755
+ 7117,
2756
+ 7122,
2757
+ 7125,
2758
+ 7166,
2759
+ 7182,
2760
+ 7199,
2761
+ 7207,
2762
+ 7212,
2763
+ 7215,
2764
+ 7232,
2765
+ 7243,
2766
+ 7246,
2767
+ 7250,
2768
+ 7253,
2769
+ 7258,
2770
+ 7263,
2771
+ 7267,
2772
+ 7270,
2773
+ 7274,
2774
+ 7280,
2775
+ 7286,
2776
+ 7293,
2777
+ 7298,
2778
+ 7302,
2779
+ 7306,
2780
+ 7316,
2781
+ 7325,
2782
+ 7326,
2783
+ 7334,
2784
+ 7356,
2785
+ 7357,
2786
+ 7363,
2787
+ 7364,
2788
+ 7367,
2789
+ 7385,
2790
+ 7392,
2791
+ 7399,
2792
+ 7405,
2793
+ 7416,
2794
+ 7420,
2795
+ 7421,
2796
+ 7426,
2797
+ 7452,
2798
+ 7476,
2799
+ 7481,
2800
+ 7519,
2801
+ 7534,
2802
+ 7542,
2803
+ 7546,
2804
+ 7573,
2805
+ 7585,
2806
+ 7601,
2807
+ 7604,
2808
+ 7606,
2809
+ 7609,
2810
+ 7629,
2811
+ 7649,
2812
+ 7653,
2813
+ 7667,
2814
+ 7682,
2815
+ 7699,
2816
+ 7738,
2817
+ 7750,
2818
+ 7786,
2819
+ 7798,
2820
+ 7800,
2821
+ 7801,
2822
+ 7805,
2823
+ 7806,
2824
+ 7811,
2825
+ 7813,
2826
+ 7832,
2827
+ 7837,
2828
+ 7849,
2829
+ 7856,
2830
+ 7876,
2831
+ 7877,
2832
+ 7887,
2833
+ 7905,
2834
+ 7916,
2835
+ 7919,
2836
+ 7920,
2837
+ 7922,
2838
+ 7923,
2839
+ 7926,
2840
+ 7944,
2841
+ 7961,
2842
+ 7966,
2843
+ 7970,
2844
+ 7973,
2845
+ 7974,
2846
+ 7976,
2847
+ 7986,
2848
+ 7999,
2849
+ 8027,
2850
+ 8028,
2851
+ 8034,
2852
+ 8047,
2853
+ 8068,
2854
+ 8074,
2855
+ 8077,
2856
+ 8091,
2857
+ 8120,
2858
+ 8122,
2859
+ 8125,
2860
+ 8152,
2861
+ 8153,
2862
+ 8164,
2863
+ 8167,
2864
+ 8169,
2865
+ 8171,
2866
+ 8177,
2867
+ 8184,
2868
+ 8189,
2869
+ 8192,
2870
+ 8196,
2871
+ 8202,
2872
+ 8212,
2873
+ 8217,
2874
+ 8231,
2875
+ 8242,
2876
+ 8244,
2877
+ 8250,
2878
+ 8256,
2879
+ 8257,
2880
+ 8265,
2881
+ 8270,
2882
+ 8274,
2883
+ 8283,
2884
+ 8290,
2885
+ 8294,
2886
+ 8301,
2887
+ 8302,
2888
+ 8307,
2889
+ 8318,
2890
+ 8326,
2891
+ 8338,
2892
+ 8349,
2893
+ 8350,
2894
+ 8353,
2895
+ 8357,
2896
+ 8371,
2897
+ 8374,
2898
+ 8377,
2899
+ 8380,
2900
+ 8387,
2901
+ 8388,
2902
+ 8396,
2903
+ 8402,
2904
+ 8419,
2905
+ 8423,
2906
+ 8428,
2907
+ 8435,
2908
+ 8439,
2909
+ 8442,
2910
+ 8444,
2911
+ 8453,
2912
+ 8461,
2913
+ 8475,
2914
+ 8481,
2915
+ 8485,
2916
+ 8493,
2917
+ 8495,
2918
+ 8498,
2919
+ 8523,
2920
+ 8530,
2921
+ 8531,
2922
+ 8562
2923
+ ],
2924
+ "early_stopping_patience": 3
2925
+ }
phase1/ablations/no_context/README.md ADDED
@@ -0,0 +1,80 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: peft
3
+ model_name: phase1-qwen-no-context-ablation
4
+ tags:
5
+ - base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct
6
+ - dpo
7
+ - lora
8
+ - transformers
9
+ - trl
10
+ license: apache-2.0
11
+ base_model: Qwen/Qwen2.5-1.5B-Instruct
12
+ pipeline_tag: text-generation
13
+ ---
14
+
15
+ # Phase 1 Qwen `no_context` diagnostic ablation
16
+
17
+ This is the Phase 1 `no_context` diagnostic LoRA-DPO adapter fine-tuned from
18
+ [Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct).
19
+ The frozen training recipe and membership hashes are included in this directory.
20
+
21
+ ## Quick start
22
+
23
+ ```python
24
+ from peft import PeftModel
25
+ from transformers import AutoModelForCausalLM, AutoTokenizer
26
+
27
+ repo_id = "geyuxu/york-milestone-project-self-traing-loop-model"
28
+ subfolder = "phase1/ablations/no_context"
29
+ base_id = "Qwen/Qwen2.5-1.5B-Instruct"
30
+
31
+ tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder)
32
+ base_model = AutoModelForCausalLM.from_pretrained(
33
+ base_id, torch_dtype="auto", device_map="auto"
34
+ )
35
+ model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder)
36
+ ```
37
+
38
+ ## Training procedure
39
+
40
+
41
+
42
+
43
+
44
+ This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290).
45
+
46
+ ### Framework versions
47
+
48
+ - PEFT 0.18.1
49
+ - TRL: 0.29.0
50
+ - Transformers: 5.3.0
51
+ - Pytorch: 2.10.0
52
+ - Datasets: 4.6.1
53
+ - Tokenizers: 0.22.2
54
+
55
+ ## Citations
56
+
57
+ Cite DPO as:
58
+
59
+ ```bibtex
60
+ @inproceedings{rafailov2023direct,
61
+ title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}},
62
+ author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn},
63
+ year = 2023,
64
+ booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023},
65
+ url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html},
66
+ editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine},
67
+ }
68
+ ```
69
+
70
+ Cite TRL as:
71
+
72
+ ```bibtex
73
+ @software{vonwerra2020trl,
74
+ title = {{TRL: Transformers Reinforcement Learning}},
75
+ author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin},
76
+ license = {Apache-2.0},
77
+ url = {https://github.com/huggingface/trl},
78
+ year = {2020}
79
+ }
80
+ ```
phase1/ablations/no_context/adapter_config.json ADDED
@@ -0,0 +1,43 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 32,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "megatron_config": null,
23
+ "megatron_core": "megatron.core",
24
+ "modules_to_save": null,
25
+ "peft_type": "LORA",
26
+ "peft_version": "0.18.1",
27
+ "qalora_group_size": 16,
28
+ "r": 16,
29
+ "rank_pattern": {},
30
+ "revision": null,
31
+ "target_modules": [
32
+ "v_proj",
33
+ "k_proj",
34
+ "o_proj",
35
+ "q_proj"
36
+ ],
37
+ "target_parameters": null,
38
+ "task_type": "CAUSAL_LM",
39
+ "trainable_token_indices": null,
40
+ "use_dora": false,
41
+ "use_qalora": false,
42
+ "use_rslora": false
43
+ }
phase1/ablations/no_context/adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6f3a8ff3c19fd3e0ff728feab4e0a73a33c71608510f37d9dd27e53b74f97523
3
+ size 17462432
phase1/ablations/no_context/chat_template.jinja ADDED
@@ -0,0 +1,54 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0]['role'] == 'system' %}
4
+ {{- messages[0]['content'] }}
5
+ {%- else %}
6
+ {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }}
7
+ {%- endif %}
8
+ {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
9
+ {%- for tool in tools %}
10
+ {{- "\n" }}
11
+ {{- tool | tojson }}
12
+ {%- endfor %}
13
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
14
+ {%- else %}
15
+ {%- if messages[0]['role'] == 'system' %}
16
+ {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }}
17
+ {%- else %}
18
+ {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }}
19
+ {%- endif %}
20
+ {%- endif %}
21
+ {%- for message in messages %}
22
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %}
23
+ {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
24
+ {%- elif message.role == "assistant" %}
25
+ {{- '<|im_start|>' + message.role }}
26
+ {%- if message.content %}
27
+ {{- '\n' + message.content }}
28
+ {%- endif %}
29
+ {%- for tool_call in message.tool_calls %}
30
+ {%- if tool_call.function is defined %}
31
+ {%- set tool_call = tool_call.function %}
32
+ {%- endif %}
33
+ {{- '\n<tool_call>\n{"name": "' }}
34
+ {{- tool_call.name }}
35
+ {{- '", "arguments": ' }}
36
+ {{- tool_call.arguments | tojson }}
37
+ {{- '}\n</tool_call>' }}
38
+ {%- endfor %}
39
+ {{- '<|im_end|>\n' }}
40
+ {%- elif message.role == "tool" %}
41
+ {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %}
42
+ {{- '<|im_start|>user' }}
43
+ {%- endif %}
44
+ {{- '\n<tool_response>\n' }}
45
+ {{- message.content }}
46
+ {{- '\n</tool_response>' }}
47
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
48
+ {{- '<|im_end|>\n' }}
49
+ {%- endif %}
50
+ {%- endif %}
51
+ {%- endfor %}
52
+ {%- if add_generation_prompt %}
53
+ {{- '<|im_start|>assistant\n' }}
54
+ {%- endif %}
phase1/ablations/no_context/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5
3
+ size 11422166
phase1/ablations/no_context/tokenizer_config.json ADDED
@@ -0,0 +1,29 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": null,
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|im_start|>",
10
+ "<|im_end|>",
11
+ "<|object_ref_start|>",
12
+ "<|object_ref_end|>",
13
+ "<|box_start|>",
14
+ "<|box_end|>",
15
+ "<|quad_start|>",
16
+ "<|quad_end|>",
17
+ "<|vision_start|>",
18
+ "<|vision_end|>",
19
+ "<|vision_pad|>",
20
+ "<|image_pad|>",
21
+ "<|video_pad|>"
22
+ ],
23
+ "is_local": true,
24
+ "model_max_length": 131072,
25
+ "pad_token": "<|endoftext|>",
26
+ "split_special_tokens": false,
27
+ "tokenizer_class": "Qwen2Tokenizer",
28
+ "unk_token": null
29
+ }
phase1/ablations/no_context/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dd47c7f20edcbf52ada253a96ebd7ddcb8045bdd2a75f52fdd0f51ad7bc0183e
3
+ size 5841
phase1/ablations/no_context/training_recipe.json ADDED
@@ -0,0 +1,22 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "format_version": 1,
3
+ "experiment": "confusion_ablation",
4
+ "ablation": "no_context",
5
+ "model_name": "Qwen/Qwen2.5-1.5B-Instruct",
6
+ "train_membership_sha256": "b497fa765223a9810ad784f31e1598edfa992a162146d6f94d9cdf4adcedd87d",
7
+ "validation_membership_sha256": "2f609467438cd6a01fd84b9d80c0fcd84c44767e3b2ed98f4f6a83d68a62c181",
8
+ "num_train_pairs": 77124,
9
+ "num_validation_pairs": 8563,
10
+ "transformation_seed": 22,
11
+ "validation_prompt_mode": "clean_rag",
12
+ "learning_rate": 1e-05,
13
+ "beta": 0.1,
14
+ "num_epochs": 1.0,
15
+ "seed": 22,
16
+ "max_length": 512,
17
+ "max_prompt_length": 384,
18
+ "gradient_accumulation_steps": 80,
19
+ "save_steps": 125,
20
+ "save_total_limit": 12,
21
+ "preference_pairs_format_version": 2
22
+ }
phase1/ablations/no_context/training_summary.json ADDED
@@ -0,0 +1,2925 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_name": "Qwen/Qwen2.5-1.5B-Instruct",
3
+ "resolved_model": "Qwen/Qwen2.5-1.5B-Instruct",
4
+ "num_train_records": 77124,
5
+ "num_validation_records_available": 8563,
6
+ "training_config": {
7
+ "lora_rank": 16,
8
+ "lora_alpha": 32,
9
+ "learning_rate": 1e-05,
10
+ "num_epochs": 1.0,
11
+ "per_device_batch_size": 1,
12
+ "per_device_eval_batch_size": 1,
13
+ "gradient_accumulation_steps": 80,
14
+ "beta": 0.1,
15
+ "max_length": 512,
16
+ "max_prompt_length": 384,
17
+ "seed": 22,
18
+ "save_steps": 125,
19
+ "save_total_limit": 12,
20
+ "resume_from_checkpoint": null,
21
+ "precision_dtype": "torch.bfloat16",
22
+ "bf16": true,
23
+ "fp16": false,
24
+ "tokenizer_add_bos_token": false
25
+ },
26
+ "global_step": 965,
27
+ "best_metric": 0.5303567051887512,
28
+ "best_model_checkpoint": "outputs/confusion_ablation_phase1_repair_v3/no_context/lora/checkpoint-875",
29
+ "train_metrics": {
30
+ "train_runtime": 22000.2483,
31
+ "train_samples_per_second": 3.506,
32
+ "train_steps_per_second": 0.044,
33
+ "total_flos": 1.2331818072769536e+17,
34
+ "train_loss": 0.4788281094842624
35
+ },
36
+ "log_history": [
37
+ {
38
+ "loss": 0.6900143623352051,
39
+ "grad_norm": 0.012825769372284412,
40
+ "learning_rate": 9.906735751295338e-06,
41
+ "entropy": 0.9465285880398006,
42
+ "num_tokens": 143734.0,
43
+ "logits/chosen": -1.5012888478025672,
44
+ "logits/rejected": -1.5723651012268272,
45
+ "mean_token_accuracy": 0.6951504178717732,
46
+ "rewards/chosen": 0.008079942484078515,
47
+ "rewards/rejected": 0.0013256204138269822,
48
+ "rewards/accuracies": 0.5425,
49
+ "rewards/margins": 0.006754322004853748,
50
+ "logps/chosen": -54.978611971139905,
51
+ "logps/rejected": -44.00920191049576,
52
+ "epoch": 0.010372905969607386,
53
+ "step": 10
54
+ },
55
+ {
56
+ "loss": 0.662090539932251,
57
+ "grad_norm": 0.01821574941277504,
58
+ "learning_rate": 9.803108808290156e-06,
59
+ "entropy": 0.9671179948747158,
60
+ "num_tokens": 288007.0,
61
+ "logits/chosen": -1.4026643295951302,
62
+ "logits/rejected": -1.5102725032640183,
63
+ "mean_token_accuracy": 0.6902420591562987,
64
+ "rewards/chosen": 0.051943560895306294,
65
+ "rewards/rejected": -0.014707293705987468,
66
+ "rewards/accuracies": 0.76875,
67
+ "rewards/margins": 0.06665085479675327,
68
+ "logps/chosen": -57.24453290700912,
69
+ "logps/rejected": -42.05887178063393,
70
+ "epoch": 0.02074581193921477,
71
+ "step": 20
72
+ },
73
+ {
74
+ "loss": 0.6254077911376953,
75
+ "grad_norm": 0.011037914082407951,
76
+ "learning_rate": 9.699481865284975e-06,
77
+ "entropy": 1.022590966722928,
78
+ "num_tokens": 433590.0,
79
+ "logits/chosen": -1.275362931486493,
80
+ "logits/rejected": -1.3053425668445908,
81
+ "mean_token_accuracy": 0.6875665122829377,
82
+ "rewards/chosen": 0.104925400447828,
83
+ "rewards/rejected": -0.05808189030554786,
84
+ "rewards/accuracies": 0.785,
85
+ "rewards/margins": 0.16300729091250105,
86
+ "logps/chosen": -56.563721351623535,
87
+ "logps/rejected": -44.831772941350934,
88
+ "epoch": 0.031118717908822157,
89
+ "step": 30
90
+ },
91
+ {
92
+ "loss": 0.5835778713226318,
93
+ "grad_norm": 0.011659706942737103,
94
+ "learning_rate": 9.595854922279793e-06,
95
+ "entropy": 1.0491496316390112,
96
+ "num_tokens": 579257.0,
97
+ "logits/chosen": -1.103721370379413,
98
+ "logits/rejected": -1.1007857062801798,
99
+ "mean_token_accuracy": 0.6836125956382603,
100
+ "rewards/chosen": 0.10443844198705847,
101
+ "rewards/rejected": -0.17612101439032812,
102
+ "rewards/accuracies": 0.79875,
103
+ "rewards/margins": 0.2805594558198936,
104
+ "logps/chosen": -56.31521392583847,
105
+ "logps/rejected": -44.80111095190048,
106
+ "epoch": 0.04149162387842954,
107
+ "step": 40
108
+ },
109
+ {
110
+ "loss": 0.5701297760009766,
111
+ "grad_norm": 0.009541669860482216,
112
+ "learning_rate": 9.492227979274612e-06,
113
+ "entropy": 1.1355412375973537,
114
+ "num_tokens": 724279.0,
115
+ "logits/chosen": -0.9254812350216316,
116
+ "logits/rejected": -0.9079043695626247,
117
+ "mean_token_accuracy": 0.6852783388644457,
118
+ "rewards/chosen": 0.054056347796804405,
119
+ "rewards/rejected": -0.30969686928990997,
120
+ "rewards/accuracies": 0.78,
121
+ "rewards/margins": 0.3637532171921339,
122
+ "logps/chosen": -57.41013575792313,
123
+ "logps/rejected": -45.747311503887175,
124
+ "epoch": 0.051864529848036925,
125
+ "step": 50
126
+ },
127
+ {
128
+ "loss": 0.5617631912231446,
129
+ "grad_norm": 0.007650681305676699,
130
+ "learning_rate": 9.388601036269432e-06,
131
+ "entropy": 1.1949225943023338,
132
+ "num_tokens": 868037.0,
133
+ "logits/chosen": -0.8281910829349749,
134
+ "logits/rejected": -0.7978684013816298,
135
+ "mean_token_accuracy": 0.6832736423797905,
136
+ "rewards/chosen": -0.03967508725108928,
137
+ "rewards/rejected": -0.47718707822641593,
138
+ "rewards/accuracies": 0.76625,
139
+ "rewards/margins": 0.4375119912764058,
140
+ "logps/chosen": -56.544705327749256,
141
+ "logps/rejected": -46.81773233771324,
142
+ "epoch": 0.062237435817644314,
143
+ "step": 60
144
+ },
145
+ {
146
+ "loss": 0.5275696277618408,
147
+ "grad_norm": 0.008909703232347965,
148
+ "learning_rate": 9.284974093264249e-06,
149
+ "entropy": 1.2164792704861611,
150
+ "num_tokens": 1012838.0,
151
+ "logits/chosen": -0.8094323563514035,
152
+ "logits/rejected": -0.6994889637697067,
153
+ "mean_token_accuracy": 0.6774187626503408,
154
+ "rewards/chosen": -0.13885413558671644,
155
+ "rewards/rejected": -0.6821774935087888,
156
+ "rewards/accuracies": 0.78875,
157
+ "rewards/margins": 0.5433233577781357,
158
+ "logps/chosen": -59.331356877088545,
159
+ "logps/rejected": -48.74847481250763,
160
+ "epoch": 0.0726103417872517,
161
+ "step": 70
162
+ },
163
+ {
164
+ "loss": 0.5331552982330322,
165
+ "grad_norm": 0.009889204055070877,
166
+ "learning_rate": 9.181347150259067e-06,
167
+ "entropy": 1.3044282801821827,
168
+ "num_tokens": 1157318.0,
169
+ "logits/chosen": -0.7322735281718121,
170
+ "logits/rejected": -0.641984971321019,
171
+ "mean_token_accuracy": 0.6695321470685304,
172
+ "rewards/chosen": -0.2586568782431277,
173
+ "rewards/rejected": -0.8568377101852093,
174
+ "rewards/accuracies": 0.7625,
175
+ "rewards/margins": 0.5981808328768239,
176
+ "logps/chosen": -59.761966693401334,
177
+ "logps/rejected": -52.77639355659485,
178
+ "epoch": 0.08298324775685909,
179
+ "step": 80
180
+ },
181
+ {
182
+ "loss": 0.5138424873352051,
183
+ "grad_norm": 0.009201128035783768,
184
+ "learning_rate": 9.077720207253888e-06,
185
+ "entropy": 1.2985483697801827,
186
+ "num_tokens": 1301440.0,
187
+ "logits/chosen": -0.7244757922082572,
188
+ "logits/rejected": -0.6446976643569048,
189
+ "mean_token_accuracy": 0.6679086892027408,
190
+ "rewards/chosen": -0.3228293718020723,
191
+ "rewards/rejected": -1.0106709606619553,
192
+ "rewards/accuracies": 0.78125,
193
+ "rewards/margins": 0.6878415882331319,
194
+ "logps/chosen": -61.18230092167855,
195
+ "logps/rejected": -53.36138055682182,
196
+ "epoch": 0.09335615372646647,
197
+ "step": 90
198
+ },
199
+ {
200
+ "loss": 0.5422882556915283,
201
+ "grad_norm": 0.011827374808490276,
202
+ "learning_rate": 8.974093264248706e-06,
203
+ "entropy": 1.3437509477324783,
204
+ "num_tokens": 1450582.0,
205
+ "logits/chosen": -0.6577579178959528,
206
+ "logits/rejected": -0.6052760341023756,
207
+ "mean_token_accuracy": 0.6652949979342521,
208
+ "rewards/chosen": -0.48851178389566485,
209
+ "rewards/rejected": -1.1487117192932055,
210
+ "rewards/accuracies": 0.75,
211
+ "rewards/margins": 0.660199935096316,
212
+ "logps/chosen": -66.8969352221489,
213
+ "logps/rejected": -59.775410163402555,
214
+ "epoch": 0.10372905969607385,
215
+ "step": 100
216
+ },
217
+ {
218
+ "loss": 0.4941854953765869,
219
+ "grad_norm": 0.009122959338128567,
220
+ "learning_rate": 8.870466321243523e-06,
221
+ "entropy": 1.3095360630284996,
222
+ "num_tokens": 1596102.0,
223
+ "logits/chosen": -0.7076684162519699,
224
+ "logits/rejected": -0.6176523284098799,
225
+ "mean_token_accuracy": 0.6634110971167684,
226
+ "rewards/chosen": -0.461084103367175,
227
+ "rewards/rejected": -1.2571547295921481,
228
+ "rewards/accuracies": 0.805,
229
+ "rewards/margins": 0.7960706273838878,
230
+ "logps/chosen": -62.40037791490555,
231
+ "logps/rejected": -55.013062043190004,
232
+ "epoch": 0.11410196566568125,
233
+ "step": 110
234
+ },
235
+ {
236
+ "loss": 0.5182926654815674,
237
+ "grad_norm": 0.009255604818463326,
238
+ "learning_rate": 8.766839378238343e-06,
239
+ "entropy": 1.3175755373714493,
240
+ "num_tokens": 1741007.0,
241
+ "logits/chosen": -0.7542329802157357,
242
+ "logits/rejected": -0.6569479564448296,
243
+ "mean_token_accuracy": 0.6686466364003718,
244
+ "rewards/chosen": -0.5461745312937274,
245
+ "rewards/rejected": -1.3049446252000052,
246
+ "rewards/accuracies": 0.78125,
247
+ "rewards/margins": 0.7587700937641785,
248
+ "logps/chosen": -63.756407718658444,
249
+ "logps/rejected": -53.10148733973503,
250
+ "epoch": 0.12447487163528863,
251
+ "step": 120
252
+ },
253
+ {
254
+ "eval_loss": 0.6102487444877625,
255
+ "eval_runtime": 187.9736,
256
+ "eval_samples_per_second": 5.32,
257
+ "eval_steps_per_second": 5.32,
258
+ "eval_entropy": 0.9602043167352676,
259
+ "eval_num_tokens": 1813585.0,
260
+ "eval_logits/chosen": -0.35928736165014746,
261
+ "eval_logits/rejected": -0.2653593227174459,
262
+ "eval_mean_token_accuracy": 0.71722535353899,
263
+ "eval_rewards/chosen": -0.11001014763419516,
264
+ "eval_rewards/rejected": -0.37161904421189684,
265
+ "eval_rewards/accuracies": 0.674,
266
+ "eval_rewards/margins": 0.2616088960794732,
267
+ "eval_logps/chosen": -51.27308830451965,
268
+ "eval_logps/rejected": -56.35606210327148,
269
+ "epoch": 0.1296613246200923,
270
+ "step": 125
271
+ },
272
+ {
273
+ "loss": 0.5195056438446045,
274
+ "grad_norm": 0.00852493941783905,
275
+ "learning_rate": 8.663212435233162e-06,
276
+ "entropy": 1.3568350885761902,
277
+ "num_tokens": 1887149.0,
278
+ "logits/chosen": -0.6995870647573145,
279
+ "logits/rejected": -0.6066075725004298,
280
+ "mean_token_accuracy": 0.6595153860282152,
281
+ "rewards/chosen": -0.5691824928086499,
282
+ "rewards/rejected": -1.3477147495548707,
283
+ "rewards/accuracies": 0.77125,
284
+ "rewards/margins": 0.7785322573361918,
285
+ "logps/chosen": -63.50056747078896,
286
+ "logps/rejected": -57.747277438640594,
287
+ "epoch": 0.13484777760489602,
288
+ "step": 130
289
+ },
290
+ {
291
+ "loss": 0.5127462863922119,
292
+ "grad_norm": 0.010999510996043682,
293
+ "learning_rate": 8.55958549222798e-06,
294
+ "entropy": 1.2911182015296072,
295
+ "num_tokens": 2030779.0,
296
+ "logits/chosen": -0.8425986763113174,
297
+ "logits/rejected": -0.6790966632280194,
298
+ "mean_token_accuracy": 0.6699926462769509,
299
+ "rewards/chosen": -0.5714914060512092,
300
+ "rewards/rejected": -1.3701531535839604,
301
+ "rewards/accuracies": 0.79,
302
+ "rewards/margins": 0.798661746904254,
303
+ "logps/chosen": -58.21274412512779,
304
+ "logps/rejected": -57.35458103775978,
305
+ "epoch": 0.1452206835745034,
306
+ "step": 140
307
+ },
308
+ {
309
+ "loss": 0.4771514892578125,
310
+ "grad_norm": 0.007932349108159542,
311
+ "learning_rate": 8.455958549222799e-06,
312
+ "entropy": 1.3540867683663964,
313
+ "num_tokens": 2177571.0,
314
+ "logits/chosen": -0.7752437049236788,
315
+ "logits/rejected": -0.6567138403536552,
316
+ "mean_token_accuracy": 0.6547455007676035,
317
+ "rewards/chosen": -0.5410610925909713,
318
+ "rewards/rejected": -1.4754458899376914,
319
+ "rewards/accuracies": 0.7975,
320
+ "rewards/margins": 0.9343847993016243,
321
+ "logps/chosen": -62.85497339010239,
322
+ "logps/rejected": -59.90050791025162,
323
+ "epoch": 0.1555935895441108,
324
+ "step": 150
325
+ },
326
+ {
327
+ "loss": 0.5065268516540528,
328
+ "grad_norm": 0.009417089633643627,
329
+ "learning_rate": 8.352331606217617e-06,
330
+ "entropy": 1.3703182196151464,
331
+ "num_tokens": 2323969.0,
332
+ "logits/chosen": -0.7446562811347729,
333
+ "logits/rejected": -0.6594706622933276,
334
+ "mean_token_accuracy": 0.6509130381792784,
335
+ "rewards/chosen": -0.6582208207750955,
336
+ "rewards/rejected": -1.4940199976743316,
337
+ "rewards/accuracies": 0.79125,
338
+ "rewards/margins": 0.8357991751469672,
339
+ "logps/chosen": -67.1081642484665,
340
+ "logps/rejected": -60.26060558557511,
341
+ "epoch": 0.16596649551371817,
342
+ "step": 160
343
+ },
344
+ {
345
+ "loss": 0.49721107482910154,
346
+ "grad_norm": 0.009800152853131294,
347
+ "learning_rate": 8.248704663212436e-06,
348
+ "entropy": 1.366801006840542,
349
+ "num_tokens": 2470885.0,
350
+ "logits/chosen": -0.6928292309660968,
351
+ "logits/rejected": -0.6209869620155596,
352
+ "mean_token_accuracy": 0.6535427515022456,
353
+ "rewards/chosen": -0.6162330767056119,
354
+ "rewards/rejected": -1.5209841228489678,
355
+ "rewards/accuracies": 0.78875,
356
+ "rewards/margins": 0.9047510461229831,
357
+ "logps/chosen": -66.02899884462357,
358
+ "logps/rejected": -58.60980107545853,
359
+ "epoch": 0.17633940148332555,
360
+ "step": 170
361
+ },
362
+ {
363
+ "loss": 0.4829860210418701,
364
+ "grad_norm": 0.008786365389823914,
365
+ "learning_rate": 8.145077720207254e-06,
366
+ "entropy": 1.3717705434653908,
367
+ "num_tokens": 2615121.0,
368
+ "logits/chosen": -0.6580562375952098,
369
+ "logits/rejected": -0.5878139433574051,
370
+ "mean_token_accuracy": 0.6564870945271104,
371
+ "rewards/chosen": -0.5556664189803269,
372
+ "rewards/rejected": -1.4979612402966085,
373
+ "rewards/accuracies": 0.7825,
374
+ "rewards/margins": 0.9422948203328997,
375
+ "logps/chosen": -62.85998333334923,
376
+ "logps/rejected": -57.214853674173355,
377
+ "epoch": 0.18671230745293294,
378
+ "step": 180
379
+ },
380
+ {
381
+ "loss": 0.4684004783630371,
382
+ "grad_norm": 0.009316110983490944,
383
+ "learning_rate": 8.041450777202073e-06,
384
+ "entropy": 1.4150286172702908,
385
+ "num_tokens": 2758874.0,
386
+ "logits/chosen": -0.6699597359601204,
387
+ "logits/rejected": -0.5473851034553693,
388
+ "mean_token_accuracy": 0.6443419794179499,
389
+ "rewards/chosen": -0.503764379483473,
390
+ "rewards/rejected": -1.4732603453175397,
391
+ "rewards/accuracies": 0.7825,
392
+ "rewards/margins": 0.9694959655869753,
393
+ "logps/chosen": -65.26039588212967,
394
+ "logps/rejected": -55.79923560500145,
395
+ "epoch": 0.19708521342254032,
396
+ "step": 190
397
+ },
398
+ {
399
+ "loss": 0.5344902038574219,
400
+ "grad_norm": 0.013661396689713001,
401
+ "learning_rate": 7.937823834196891e-06,
402
+ "entropy": 1.3751253792829812,
403
+ "num_tokens": 2902718.0,
404
+ "logits/chosen": -0.65461918654035,
405
+ "logits/rejected": -0.5536890222464702,
406
+ "mean_token_accuracy": 0.6590519631467759,
407
+ "rewards/chosen": -0.5584196869007791,
408
+ "rewards/rejected": -1.4234223538136574,
409
+ "rewards/accuracies": 0.77125,
410
+ "rewards/margins": 0.8650026666652412,
411
+ "logps/chosen": -61.13262881875038,
412
+ "logps/rejected": -56.61175240635872,
413
+ "epoch": 0.2074581193921477,
414
+ "step": 200
415
+ },
416
+ {
417
+ "loss": 0.4941723823547363,
418
+ "grad_norm": 0.008777705021202564,
419
+ "learning_rate": 7.834196891191712e-06,
420
+ "entropy": 1.3652805363852532,
421
+ "num_tokens": 3043885.0,
422
+ "logits/chosen": -0.7452820956668422,
423
+ "logits/rejected": -0.6034335554689337,
424
+ "mean_token_accuracy": 0.6580210606381297,
425
+ "rewards/chosen": -0.45352055150666276,
426
+ "rewards/rejected": -1.3747392913223302,
427
+ "rewards/accuracies": 0.78125,
428
+ "rewards/margins": 0.9212187370774336,
429
+ "logps/chosen": -58.416047328710555,
430
+ "logps/rejected": -53.947862002849575,
431
+ "epoch": 0.2178310253617551,
432
+ "step": 210
433
+ },
434
+ {
435
+ "loss": 0.47504258155822754,
436
+ "grad_norm": 0.009036123752593994,
437
+ "learning_rate": 7.730569948186528e-06,
438
+ "entropy": 1.4040400226414205,
439
+ "num_tokens": 3190499.0,
440
+ "logits/chosen": -0.6346807976930225,
441
+ "logits/rejected": -0.5184029459658583,
442
+ "mean_token_accuracy": 0.6466581939533352,
443
+ "rewards/chosen": -0.536972903214264,
444
+ "rewards/rejected": -1.5215354163426673,
445
+ "rewards/accuracies": 0.8025,
446
+ "rewards/margins": 0.984562511825934,
447
+ "logps/chosen": -62.78493340015412,
448
+ "logps/rejected": -58.09246099233627,
449
+ "epoch": 0.2282039313313625,
450
+ "step": 220
451
+ },
452
+ {
453
+ "loss": 0.45198073387146,
454
+ "grad_norm": 0.007527140900492668,
455
+ "learning_rate": 7.626943005181348e-06,
456
+ "entropy": 1.4020196551457047,
457
+ "num_tokens": 3337768.0,
458
+ "logits/chosen": -0.6210873045715655,
459
+ "logits/rejected": -0.5822921518676821,
460
+ "mean_token_accuracy": 0.6555538633279503,
461
+ "rewards/chosen": -0.4542729445986333,
462
+ "rewards/rejected": -1.5461742853268516,
463
+ "rewards/accuracies": 0.8175,
464
+ "rewards/margins": 1.091901341448538,
465
+ "logps/chosen": -67.90270529866218,
466
+ "logps/rejected": -58.65799897551537,
467
+ "epoch": 0.23857683730096987,
468
+ "step": 230
469
+ },
470
+ {
471
+ "loss": 0.4732102870941162,
472
+ "grad_norm": 0.016743697226047516,
473
+ "learning_rate": 7.523316062176167e-06,
474
+ "entropy": 1.408635692326352,
475
+ "num_tokens": 3483520.0,
476
+ "logits/chosen": -0.5801546989494524,
477
+ "logits/rejected": -0.5212051543725787,
478
+ "mean_token_accuracy": 0.6469839760102332,
479
+ "rewards/chosen": -0.5587615105054283,
480
+ "rewards/rejected": -1.562202037232928,
481
+ "rewards/accuracies": 0.8,
482
+ "rewards/margins": 1.003440523883328,
483
+ "logps/chosen": -65.64231182932853,
484
+ "logps/rejected": -58.95616222620011,
485
+ "epoch": 0.24894974327057726,
486
+ "step": 240
487
+ },
488
+ {
489
+ "loss": 0.48830270767211914,
490
+ "grad_norm": 0.010347820818424225,
491
+ "learning_rate": 7.419689119170985e-06,
492
+ "entropy": 1.3876401880290359,
493
+ "num_tokens": 3629401.0,
494
+ "logits/chosen": -0.6944931846154596,
495
+ "logits/rejected": -0.5525909304478883,
496
+ "mean_token_accuracy": 0.6595196689106524,
497
+ "rewards/chosen": -0.5708247896161629,
498
+ "rewards/rejected": -1.5276743739199445,
499
+ "rewards/accuracies": 0.7825,
500
+ "rewards/margins": 0.9568495863489807,
501
+ "logps/chosen": -65.0908039200306,
502
+ "logps/rejected": -59.28663974046707,
503
+ "epoch": 0.2593226492401846,
504
+ "step": 250
505
+ },
506
+ {
507
+ "eval_loss": 0.586716890335083,
508
+ "eval_runtime": 218.1079,
509
+ "eval_samples_per_second": 4.585,
510
+ "eval_steps_per_second": 4.585,
511
+ "eval_entropy": 0.9768514372222126,
512
+ "eval_num_tokens": 3629401.0,
513
+ "eval_logits/chosen": -0.288027065089679,
514
+ "eval_logits/rejected": -0.1875060971678181,
515
+ "eval_mean_token_accuracy": 0.715995571538806,
516
+ "eval_rewards/chosen": -0.13773577162688888,
517
+ "eval_rewards/rejected": -0.4831975232921541,
518
+ "eval_rewards/accuracies": 0.7,
519
+ "eval_rewards/margins": 0.3454617517972365,
520
+ "eval_logps/chosen": -51.550344535827634,
521
+ "eval_logps/rejected": -57.47184686470032,
522
+ "epoch": 0.2593226492401846,
523
+ "step": 250
524
+ },
525
+ {
526
+ "loss": 0.5234602928161621,
527
+ "grad_norm": 0.01417848002165556,
528
+ "learning_rate": 7.3160621761658035e-06,
529
+ "entropy": 1.4126720386464149,
530
+ "num_tokens": 3776772.0,
531
+ "logits/chosen": -0.6336535534010754,
532
+ "logits/rejected": -0.5590520939183056,
533
+ "mean_token_accuracy": 0.6559896361455322,
534
+ "rewards/chosen": -0.607539504897577,
535
+ "rewards/rejected": -1.5568346106001991,
536
+ "rewards/accuracies": 0.76625,
537
+ "rewards/margins": 0.9492951015941798,
538
+ "logps/chosen": -67.75836271762847,
539
+ "logps/rejected": -60.43963164687157,
540
+ "epoch": 0.26969555520979205,
541
+ "step": 260
542
+ },
543
+ {
544
+ "loss": 0.45171551704406737,
545
+ "grad_norm": 0.008155270479619503,
546
+ "learning_rate": 7.212435233160623e-06,
547
+ "entropy": 1.386252193665132,
548
+ "num_tokens": 3918594.0,
549
+ "logits/chosen": -0.692322886394876,
550
+ "logits/rejected": -0.5863808643424501,
551
+ "mean_token_accuracy": 0.6557753992639482,
552
+ "rewards/chosen": -0.4844140848268034,
553
+ "rewards/rejected": -1.5001980412582634,
554
+ "rewards/accuracies": 0.8075,
555
+ "rewards/margins": 1.0157839558646082,
556
+ "logps/chosen": -60.645376416444776,
557
+ "logps/rejected": -56.63234967470169,
558
+ "epoch": 0.28006846117939943,
559
+ "step": 270
560
+ },
561
+ {
562
+ "loss": 0.4645240306854248,
563
+ "grad_norm": 0.010044134221971035,
564
+ "learning_rate": 7.108808290155441e-06,
565
+ "entropy": 1.4262400729209184,
566
+ "num_tokens": 4064591.0,
567
+ "logits/chosen": -0.6778223895913023,
568
+ "logits/rejected": -0.5782403406452822,
569
+ "mean_token_accuracy": 0.6480579270608723,
570
+ "rewards/chosen": -0.4780267339639249,
571
+ "rewards/rejected": -1.5043474953982514,
572
+ "rewards/accuracies": 0.81,
573
+ "rewards/margins": 1.0263207618752495,
574
+ "logps/chosen": -66.15268970012664,
575
+ "logps/rejected": -56.97477602481842,
576
+ "epoch": 0.2904413671490068,
577
+ "step": 280
578
+ },
579
+ {
580
+ "loss": 0.48730764389038084,
581
+ "grad_norm": 0.011102184653282166,
582
+ "learning_rate": 7.005181347150259e-06,
583
+ "entropy": 1.3913073570653796,
584
+ "num_tokens": 4210880.0,
585
+ "logits/chosen": -0.6611820471311323,
586
+ "logits/rejected": -0.5711755343264715,
587
+ "mean_token_accuracy": 0.6609016039222478,
588
+ "rewards/chosen": -0.5330563006985176,
589
+ "rewards/rejected": -1.4805517839052482,
590
+ "rewards/accuracies": 0.79125,
591
+ "rewards/margins": 0.9474954811111093,
592
+ "logps/chosen": -64.55881326556205,
593
+ "logps/rejected": -58.55792887210846,
594
+ "epoch": 0.3008142731186142,
595
+ "step": 290
596
+ },
597
+ {
598
+ "loss": 0.4731907367706299,
599
+ "grad_norm": 0.008548606187105179,
600
+ "learning_rate": 6.9015544041450784e-06,
601
+ "entropy": 1.3624146432522684,
602
+ "num_tokens": 4356383.0,
603
+ "logits/chosen": -0.6928838046169237,
604
+ "logits/rejected": -0.6042798964782825,
605
+ "mean_token_accuracy": 0.6615170135349036,
606
+ "rewards/chosen": -0.562419148215231,
607
+ "rewards/rejected": -1.5397747305584197,
608
+ "rewards/accuracies": 0.8075,
609
+ "rewards/margins": 0.9773555782041512,
610
+ "logps/chosen": -63.553271045684816,
611
+ "logps/rejected": -58.97647937297821,
612
+ "epoch": 0.3111871790882216,
613
+ "step": 300
614
+ },
615
+ {
616
+ "loss": 0.49598259925842286,
617
+ "grad_norm": 0.007993742823600769,
618
+ "learning_rate": 6.797927461139897e-06,
619
+ "entropy": 1.3700548317469656,
620
+ "num_tokens": 4504654.0,
621
+ "logits/chosen": -0.644779540875669,
622
+ "logits/rejected": -0.5648210397573508,
623
+ "mean_token_accuracy": 0.6573794655874372,
624
+ "rewards/chosen": -0.5243248527575634,
625
+ "rewards/rejected": -1.5287844626943115,
626
+ "rewards/accuracies": 0.78625,
627
+ "rewards/margins": 1.00445960723795,
628
+ "logps/chosen": -64.00666294693947,
629
+ "logps/rejected": -61.50243379831314,
630
+ "epoch": 0.32156008505782896,
631
+ "step": 310
632
+ },
633
+ {
634
+ "loss": 0.4658979415893555,
635
+ "grad_norm": 0.010582108981907368,
636
+ "learning_rate": 6.6943005181347155e-06,
637
+ "entropy": 1.377428816948086,
638
+ "num_tokens": 4649289.0,
639
+ "logits/chosen": -0.6946231373321079,
640
+ "logits/rejected": -0.615736163527076,
641
+ "mean_token_accuracy": 0.6496203068085015,
642
+ "rewards/chosen": -0.5053178700394346,
643
+ "rewards/rejected": -1.5253387601411668,
644
+ "rewards/accuracies": 0.7975,
645
+ "rewards/margins": 1.020020889963489,
646
+ "logps/chosen": -65.05610402703286,
647
+ "logps/rejected": -58.5456183898449,
648
+ "epoch": 0.33193299102743634,
649
+ "step": 320
650
+ },
651
+ {
652
+ "loss": 0.4793886661529541,
653
+ "grad_norm": 0.010722431354224682,
654
+ "learning_rate": 6.590673575129535e-06,
655
+ "entropy": 1.4115223482623696,
656
+ "num_tokens": 4794149.0,
657
+ "logits/chosen": -0.640069723947673,
658
+ "logits/rejected": -0.5809591451997832,
659
+ "mean_token_accuracy": 0.6453945213742555,
660
+ "rewards/chosen": -0.495894172671542,
661
+ "rewards/rejected": -1.5554326001886511,
662
+ "rewards/accuracies": 0.77875,
663
+ "rewards/margins": 1.059538428708911,
664
+ "logps/chosen": -64.34471502423287,
665
+ "logps/rejected": -60.021323671340944,
666
+ "epoch": 0.3423058969970437,
667
+ "step": 330
668
+ },
669
+ {
670
+ "loss": 0.4895618438720703,
671
+ "grad_norm": 0.012254049070179462,
672
+ "learning_rate": 6.487046632124353e-06,
673
+ "entropy": 1.341764758527279,
674
+ "num_tokens": 4938961.0,
675
+ "logits/chosen": -0.6740448118186494,
676
+ "logits/rejected": -0.6176664939637678,
677
+ "mean_token_accuracy": 0.6506805537641048,
678
+ "rewards/chosen": -0.5430054054186622,
679
+ "rewards/rejected": -1.5190805373876355,
680
+ "rewards/accuracies": 0.78125,
681
+ "rewards/margins": 0.9760751294251532,
682
+ "logps/chosen": -62.98277623295784,
683
+ "logps/rejected": -58.627308850288394,
684
+ "epoch": 0.3526788029666511,
685
+ "step": 340
686
+ },
687
+ {
688
+ "loss": 0.4906949996948242,
689
+ "grad_norm": 0.012603401206433773,
690
+ "learning_rate": 6.383419689119171e-06,
691
+ "entropy": 1.335228986721486,
692
+ "num_tokens": 5085185.0,
693
+ "logits/chosen": -0.6529947110376427,
694
+ "logits/rejected": -0.6009205883950112,
695
+ "mean_token_accuracy": 0.6537076928000897,
696
+ "rewards/chosen": -0.5141149228686117,
697
+ "rewards/rejected": -1.5397958215233667,
698
+ "rewards/accuracies": 0.78375,
699
+ "rewards/margins": 1.0256808973429725,
700
+ "logps/chosen": -65.80777725458145,
701
+ "logps/rejected": -60.204533588886264,
702
+ "epoch": 0.3630517089362585,
703
+ "step": 350
704
+ },
705
+ {
706
+ "loss": 0.4906170845031738,
707
+ "grad_norm": 0.013215990737080574,
708
+ "learning_rate": 6.2797927461139905e-06,
709
+ "entropy": 1.2594143666606397,
710
+ "num_tokens": 5230359.0,
711
+ "logits/chosen": -0.7363216904006744,
712
+ "logits/rejected": -0.6437616409973009,
713
+ "mean_token_accuracy": 0.6658474483340978,
714
+ "rewards/chosen": -0.5248335571045755,
715
+ "rewards/rejected": -1.505687792309327,
716
+ "rewards/accuracies": 0.78,
717
+ "rewards/margins": 0.9808542363531888,
718
+ "logps/chosen": -61.92662429690361,
719
+ "logps/rejected": -57.71264513731003,
720
+ "epoch": 0.37342461490586587,
721
+ "step": 360
722
+ },
723
+ {
724
+ "loss": 0.47084531784057615,
725
+ "grad_norm": 0.010505126789212227,
726
+ "learning_rate": 6.176165803108809e-06,
727
+ "entropy": 1.3553831833507866,
728
+ "num_tokens": 5376488.0,
729
+ "logits/chosen": -0.6449173292890904,
730
+ "logits/rejected": -0.5551785184102145,
731
+ "mean_token_accuracy": 0.6537860439531505,
732
+ "rewards/chosen": -0.4608478151052259,
733
+ "rewards/rejected": -1.484516432384262,
734
+ "rewards/accuracies": 0.79125,
735
+ "rewards/margins": 1.0236686167120934,
736
+ "logps/chosen": -66.82504806637763,
737
+ "logps/rejected": -58.22365792274475,
738
+ "epoch": 0.38379752087547325,
739
+ "step": 370
740
+ },
741
+ {
742
+ "eval_loss": 0.5689035654067993,
743
+ "eval_runtime": 250.9045,
744
+ "eval_samples_per_second": 3.986,
745
+ "eval_steps_per_second": 3.986,
746
+ "eval_entropy": 0.9553070103861392,
747
+ "eval_num_tokens": 5448735.0,
748
+ "eval_logits/chosen": -0.2716756952684425,
749
+ "eval_logits/rejected": -0.16629699776825788,
750
+ "eval_mean_token_accuracy": 0.7177043009251356,
751
+ "eval_rewards/chosen": -0.11320603249309352,
752
+ "eval_rewards/rejected": -0.5053918305169282,
753
+ "eval_rewards/accuracies": 0.725,
754
+ "eval_rewards/margins": 0.392185798952356,
755
+ "eval_logps/chosen": -51.3050471496582,
756
+ "eval_logps/rejected": -57.69378993988037,
757
+ "epoch": 0.38898397386027694,
758
+ "step": 375
759
+ },
760
+ {
761
+ "loss": 0.45557408332824706,
762
+ "grad_norm": 0.010905127041041851,
763
+ "learning_rate": 6.0725388601036275e-06,
764
+ "entropy": 1.3120742352865635,
765
+ "num_tokens": 5521548.0,
766
+ "logits/chosen": -0.6177198584454004,
767
+ "logits/rejected": -0.5450247570549444,
768
+ "mean_token_accuracy": 0.6573154540918767,
769
+ "rewards/chosen": -0.3887985857592139,
770
+ "rewards/rejected": -1.4611027611684404,
771
+ "rewards/accuracies": 0.815,
772
+ "rewards/margins": 1.0723041738849133,
773
+ "logps/chosen": -62.481010044813154,
774
+ "logps/rejected": -56.344697498083114,
775
+ "epoch": 0.39417042684508063,
776
+ "step": 380
777
+ },
778
+ {
779
+ "loss": 0.4662487983703613,
780
+ "grad_norm": 0.010954899713397026,
781
+ "learning_rate": 5.968911917098445e-06,
782
+ "entropy": 1.345905083543621,
783
+ "num_tokens": 5667800.0,
784
+ "logits/chosen": -0.5844921973924755,
785
+ "logits/rejected": -0.48380765844974577,
786
+ "mean_token_accuracy": 0.6540606117062271,
787
+ "rewards/chosen": -0.390090519907244,
788
+ "rewards/rejected": -1.462948713658261,
789
+ "rewards/accuracies": 0.8025,
790
+ "rewards/margins": 1.07285819449462,
791
+ "logps/chosen": -64.31483766436577,
792
+ "logps/rejected": -59.39098523259163,
793
+ "epoch": 0.404543332814688,
794
+ "step": 390
795
+ },
796
+ {
797
+ "loss": 0.46701774597167967,
798
+ "grad_norm": 0.010829386301338673,
799
+ "learning_rate": 5.865284974093265e-06,
800
+ "entropy": 1.3651179377734661,
801
+ "num_tokens": 5813205.0,
802
+ "logits/chosen": -0.5822485740098883,
803
+ "logits/rejected": -0.5166833227123047,
804
+ "mean_token_accuracy": 0.6551306374650449,
805
+ "rewards/chosen": -0.35834275034227175,
806
+ "rewards/rejected": -1.365874043785443,
807
+ "rewards/accuracies": 0.78875,
808
+ "rewards/margins": 1.0075312922801822,
809
+ "logps/chosen": -63.65349508166313,
810
+ "logps/rejected": -58.2333509349823,
811
+ "epoch": 0.4149162387842954,
812
+ "step": 400
813
+ },
814
+ {
815
+ "loss": 0.46943206787109376,
816
+ "grad_norm": 0.012473917566239834,
817
+ "learning_rate": 5.761658031088083e-06,
818
+ "entropy": 1.3225441289972515,
819
+ "num_tokens": 5959181.0,
820
+ "logits/chosen": -0.6183900032329287,
821
+ "logits/rejected": -0.5336649034548987,
822
+ "mean_token_accuracy": 0.6569803632609547,
823
+ "rewards/chosen": -0.35909413290792147,
824
+ "rewards/rejected": -1.3612432872604223,
825
+ "rewards/accuracies": 0.795,
826
+ "rewards/margins": 1.002149153780192,
827
+ "logps/chosen": -62.85942430019379,
828
+ "logps/rejected": -57.029898535013196,
829
+ "epoch": 0.4252891447539028,
830
+ "step": 410
831
+ },
832
+ {
833
+ "loss": 0.43849844932556153,
834
+ "grad_norm": 0.008844634518027306,
835
+ "learning_rate": 5.658031088082902e-06,
836
+ "entropy": 1.3128622455336154,
837
+ "num_tokens": 6104961.0,
838
+ "logits/chosen": -0.6210691174054768,
839
+ "logits/rejected": -0.576289690726631,
840
+ "mean_token_accuracy": 0.6577657607197761,
841
+ "rewards/chosen": -0.3327711314160842,
842
+ "rewards/rejected": -1.4455869932868517,
843
+ "rewards/accuracies": 0.825,
844
+ "rewards/margins": 1.1128158613247796,
845
+ "logps/chosen": -64.98676935911179,
846
+ "logps/rejected": -57.15970268011093,
847
+ "epoch": 0.4356620507235102,
848
+ "step": 420
849
+ },
850
+ {
851
+ "loss": 0.43562884330749513,
852
+ "grad_norm": 0.00888186227530241,
853
+ "learning_rate": 5.554404145077721e-06,
854
+ "entropy": 1.3373534345161169,
855
+ "num_tokens": 6251772.0,
856
+ "logits/chosen": -0.5417993838933208,
857
+ "logits/rejected": -0.4885455063213445,
858
+ "mean_token_accuracy": 0.6521896417625248,
859
+ "rewards/chosen": -0.39902110468392493,
860
+ "rewards/rejected": -1.5569669758284,
861
+ "rewards/accuracies": 0.83625,
862
+ "rewards/margins": 1.1579458705382422,
863
+ "logps/chosen": -63.90601393699646,
864
+ "logps/rejected": -58.24345481872559,
865
+ "epoch": 0.4460349566931176,
866
+ "step": 430
867
+ },
868
+ {
869
+ "loss": 0.4367820262908936,
870
+ "grad_norm": 0.011835568584501743,
871
+ "learning_rate": 5.4507772020725395e-06,
872
+ "entropy": 1.302687416060362,
873
+ "num_tokens": 6397498.0,
874
+ "logits/chosen": -0.6515899833172267,
875
+ "logits/rejected": -0.5672783053215388,
876
+ "mean_token_accuracy": 0.6643678575474768,
877
+ "rewards/chosen": -0.4223745361570036,
878
+ "rewards/rejected": -1.5821643100841902,
879
+ "rewards/accuracies": 0.8225,
880
+ "rewards/margins": 1.1597897751070558,
881
+ "logps/chosen": -62.087783161401745,
882
+ "logps/rejected": -58.09040701627731,
883
+ "epoch": 0.456407862662725,
884
+ "step": 440
885
+ },
886
+ {
887
+ "loss": 0.4615288257598877,
888
+ "grad_norm": 0.011570082977414131,
889
+ "learning_rate": 5.347150259067357e-06,
890
+ "entropy": 1.3379024799168109,
891
+ "num_tokens": 6544292.0,
892
+ "logits/chosen": -0.6416285881723627,
893
+ "logits/rejected": -0.5313172360798328,
894
+ "mean_token_accuracy": 0.6538208884559572,
895
+ "rewards/chosen": -0.43649624643381685,
896
+ "rewards/rejected": -1.6286552884728007,
897
+ "rewards/accuracies": 0.79875,
898
+ "rewards/margins": 1.192159042903222,
899
+ "logps/chosen": -62.45707392811775,
900
+ "logps/rejected": -60.70825082540512,
901
+ "epoch": 0.46678076863233237,
902
+ "step": 450
903
+ },
904
+ {
905
+ "loss": 0.4522082328796387,
906
+ "grad_norm": 0.01289224810898304,
907
+ "learning_rate": 5.243523316062177e-06,
908
+ "entropy": 1.2857942930911668,
909
+ "num_tokens": 6688703.0,
910
+ "logits/chosen": -0.6984393716749847,
911
+ "logits/rejected": -0.616657341014624,
912
+ "mean_token_accuracy": 0.6569575572758913,
913
+ "rewards/chosen": -0.4177262162156694,
914
+ "rewards/rejected": -1.5946978869343729,
915
+ "rewards/accuracies": 0.82125,
916
+ "rewards/margins": 1.1769716703612358,
917
+ "logps/chosen": -62.88765250682831,
918
+ "logps/rejected": -57.941710426807404,
919
+ "epoch": 0.47715367460193975,
920
+ "step": 460
921
+ },
922
+ {
923
+ "loss": 0.4684887886047363,
924
+ "grad_norm": 0.013750020414590836,
925
+ "learning_rate": 5.139896373056995e-06,
926
+ "entropy": 1.2873771674977617,
927
+ "num_tokens": 6831976.0,
928
+ "logits/chosen": -0.7360928165548556,
929
+ "logits/rejected": -0.6532006934035273,
930
+ "mean_token_accuracy": 0.649969874471426,
931
+ "rewards/chosen": -0.45782311129412845,
932
+ "rewards/rejected": -1.5659245843085228,
933
+ "rewards/accuracies": 0.7975,
934
+ "rewards/margins": 1.1081014727987348,
935
+ "logps/chosen": -62.05344919681549,
936
+ "logps/rejected": -57.16824733495712,
937
+ "epoch": 0.48752658057154713,
938
+ "step": 470
939
+ },
940
+ {
941
+ "loss": 0.4470407962799072,
942
+ "grad_norm": 0.010775277391076088,
943
+ "learning_rate": 5.036269430051814e-06,
944
+ "entropy": 1.3075012436602265,
945
+ "num_tokens": 6979562.0,
946
+ "logits/chosen": -0.6950100893212269,
947
+ "logits/rejected": -0.6174856653398093,
948
+ "mean_token_accuracy": 0.6546831333450973,
949
+ "rewards/chosen": -0.4612816582483902,
950
+ "rewards/rejected": -1.6060521737975069,
951
+ "rewards/accuracies": 0.79625,
952
+ "rewards/margins": 1.1447705142386257,
953
+ "logps/chosen": -65.90533972740174,
954
+ "logps/rejected": -60.80634157061577,
955
+ "epoch": 0.4978994865411545,
956
+ "step": 480
957
+ },
958
+ {
959
+ "loss": 0.44890718460083007,
960
+ "grad_norm": 0.010780111886560917,
961
+ "learning_rate": 4.932642487046633e-06,
962
+ "entropy": 1.2887511976994575,
963
+ "num_tokens": 7126641.0,
964
+ "logits/chosen": -0.6761976126203127,
965
+ "logits/rejected": -0.6278953113861633,
966
+ "mean_token_accuracy": 0.6634333984181285,
967
+ "rewards/chosen": -0.4675208572049451,
968
+ "rewards/rejected": -1.6545327439898392,
969
+ "rewards/accuracies": 0.82375,
970
+ "rewards/margins": 1.1870118879154326,
971
+ "logps/chosen": -63.26052482247353,
972
+ "logps/rejected": -61.286433795690535,
973
+ "epoch": 0.5082723925107618,
974
+ "step": 490
975
+ },
976
+ {
977
+ "loss": 0.4814422607421875,
978
+ "grad_norm": 0.012935275211930275,
979
+ "learning_rate": 4.829015544041451e-06,
980
+ "entropy": 1.27828567199409,
981
+ "num_tokens": 7271511.0,
982
+ "logits/chosen": -0.7259033669003568,
983
+ "logits/rejected": -0.6351857639096569,
984
+ "mean_token_accuracy": 0.6566927696019411,
985
+ "rewards/chosen": -0.43330920343832985,
986
+ "rewards/rejected": -1.5484318724216428,
987
+ "rewards/accuracies": 0.78875,
988
+ "rewards/margins": 1.1151226695766672,
989
+ "logps/chosen": -61.74719344258308,
990
+ "logps/rejected": -59.84465143203735,
991
+ "epoch": 0.5186452984803692,
992
+ "step": 500
993
+ },
994
+ {
995
+ "eval_loss": 0.5487673282623291,
996
+ "eval_runtime": 282.9922,
997
+ "eval_samples_per_second": 3.534,
998
+ "eval_steps_per_second": 3.534,
999
+ "eval_entropy": 0.9428232955671847,
1000
+ "eval_num_tokens": 7271511.0,
1001
+ "eval_logits/chosen": -0.28059689932805515,
1002
+ "eval_logits/rejected": -0.16151944836492374,
1003
+ "eval_mean_token_accuracy": 0.7168366620391607,
1004
+ "eval_rewards/chosen": -0.1563246784962248,
1005
+ "eval_rewards/rejected": -0.6193268298726762,
1006
+ "eval_rewards/accuracies": 0.754,
1007
+ "eval_rewards/margins": 0.4630021521952003,
1008
+ "eval_logps/chosen": -51.73623360443115,
1009
+ "eval_logps/rejected": -58.83313990974426,
1010
+ "epoch": 0.5186452984803692,
1011
+ "step": 500
1012
+ },
1013
+ {
1014
+ "loss": 0.4656700134277344,
1015
+ "grad_norm": 0.01303118746727705,
1016
+ "learning_rate": 4.72538860103627e-06,
1017
+ "entropy": 1.2692697253311054,
1018
+ "num_tokens": 7417281.0,
1019
+ "logits/chosen": -0.6733742115379525,
1020
+ "logits/rejected": -0.6193994454969072,
1021
+ "mean_token_accuracy": 0.6586294612661004,
1022
+ "rewards/chosen": -0.43541748865740376,
1023
+ "rewards/rejected": -1.5032758536882467,
1024
+ "rewards/accuracies": 0.815,
1025
+ "rewards/margins": 1.0678583633713423,
1026
+ "logps/chosen": -64.05021148204804,
1027
+ "logps/rejected": -56.13307309627533,
1028
+ "epoch": 0.5290182044499767,
1029
+ "step": 510
1030
+ },
1031
+ {
1032
+ "loss": 0.4864551067352295,
1033
+ "grad_norm": 0.01242531556636095,
1034
+ "learning_rate": 4.621761658031089e-06,
1035
+ "entropy": 1.2640815615979955,
1036
+ "num_tokens": 7560432.0,
1037
+ "logits/chosen": -0.7002353169810469,
1038
+ "logits/rejected": -0.6140356327426939,
1039
+ "mean_token_accuracy": 0.6589579802565276,
1040
+ "rewards/chosen": -0.38904498486765077,
1041
+ "rewards/rejected": -1.4170939752570848,
1042
+ "rewards/accuracies": 0.7925,
1043
+ "rewards/margins": 1.0280489912256598,
1044
+ "logps/chosen": -60.270782203674315,
1045
+ "logps/rejected": -56.58300987482071,
1046
+ "epoch": 0.5393911104195841,
1047
+ "step": 520
1048
+ },
1049
+ {
1050
+ "loss": 0.4569260597229004,
1051
+ "grad_norm": 0.01068835612386465,
1052
+ "learning_rate": 4.518134715025907e-06,
1053
+ "entropy": 1.3159204521216452,
1054
+ "num_tokens": 7705977.0,
1055
+ "logits/chosen": -0.6491517350356284,
1056
+ "logits/rejected": -0.5585772213969517,
1057
+ "mean_token_accuracy": 0.6497207802906633,
1058
+ "rewards/chosen": -0.3849831897905824,
1059
+ "rewards/rejected": -1.5199620288111328,
1060
+ "rewards/accuracies": 0.82125,
1061
+ "rewards/margins": 1.1349788387073203,
1062
+ "logps/chosen": -63.44159636735916,
1063
+ "logps/rejected": -59.03181514501571,
1064
+ "epoch": 0.5497640163891915,
1065
+ "step": 530
1066
+ },
1067
+ {
1068
+ "loss": 0.4587429046630859,
1069
+ "grad_norm": 0.013803384266793728,
1070
+ "learning_rate": 4.414507772020726e-06,
1071
+ "entropy": 1.291237823315896,
1072
+ "num_tokens": 7852079.0,
1073
+ "logits/chosen": -0.6414628461310453,
1074
+ "logits/rejected": -0.5613248039563115,
1075
+ "mean_token_accuracy": 0.6623153394274414,
1076
+ "rewards/chosen": -0.4346328362337226,
1077
+ "rewards/rejected": -1.540268263059552,
1078
+ "rewards/accuracies": 0.8125,
1079
+ "rewards/margins": 1.1056354277441278,
1080
+ "logps/chosen": -62.11032348752022,
1081
+ "logps/rejected": -58.996895933151244,
1082
+ "epoch": 0.5601369223587989,
1083
+ "step": 540
1084
+ },
1085
+ {
1086
+ "loss": 0.46028594970703124,
1087
+ "grad_norm": 0.013468707911670208,
1088
+ "learning_rate": 4.310880829015544e-06,
1089
+ "entropy": 1.3394903557561337,
1090
+ "num_tokens": 7999115.0,
1091
+ "logits/chosen": -0.5828356510219183,
1092
+ "logits/rejected": -0.5372745959336506,
1093
+ "mean_token_accuracy": 0.6568853073753417,
1094
+ "rewards/chosen": -0.4290946354267362,
1095
+ "rewards/rejected": -1.5929214715841227,
1096
+ "rewards/accuracies": 0.80625,
1097
+ "rewards/margins": 1.1638268361473456,
1098
+ "logps/chosen": -65.59857477068901,
1099
+ "logps/rejected": -62.133251576423646,
1100
+ "epoch": 0.5705098283284062,
1101
+ "step": 550
1102
+ },
1103
+ {
1104
+ "loss": 0.45781307220458983,
1105
+ "grad_norm": 0.014243297278881073,
1106
+ "learning_rate": 4.207253886010363e-06,
1107
+ "entropy": 1.2652439445722847,
1108
+ "num_tokens": 8145639.0,
1109
+ "logits/chosen": -0.6962334313624986,
1110
+ "logits/rejected": -0.6396616762561939,
1111
+ "mean_token_accuracy": 0.6539523831009865,
1112
+ "rewards/chosen": -0.42706657521594027,
1113
+ "rewards/rejected": -1.5893809160019736,
1114
+ "rewards/accuracies": 0.795,
1115
+ "rewards/margins": 1.16231434000656,
1116
+ "logps/chosen": -63.68221395015716,
1117
+ "logps/rejected": -58.812913880348205,
1118
+ "epoch": 0.5808827342980136,
1119
+ "step": 560
1120
+ },
1121
+ {
1122
+ "loss": 0.45180602073669435,
1123
+ "grad_norm": 0.011750273406505585,
1124
+ "learning_rate": 4.103626943005182e-06,
1125
+ "entropy": 1.271689679301344,
1126
+ "num_tokens": 8289932.0,
1127
+ "logits/chosen": -0.6709009276653929,
1128
+ "logits/rejected": -0.6110994225113662,
1129
+ "mean_token_accuracy": 0.6528454353101552,
1130
+ "rewards/chosen": -0.43575992634396243,
1131
+ "rewards/rejected": -1.544044768281892,
1132
+ "rewards/accuracies": 0.81875,
1133
+ "rewards/margins": 1.1082848401460796,
1134
+ "logps/chosen": -63.166086630821226,
1135
+ "logps/rejected": -56.468742752075194,
1136
+ "epoch": 0.591255640267621,
1137
+ "step": 570
1138
+ },
1139
+ {
1140
+ "loss": 0.46036481857299805,
1141
+ "grad_norm": 0.014452456496655941,
1142
+ "learning_rate": 4.000000000000001e-06,
1143
+ "entropy": 1.254093002313748,
1144
+ "num_tokens": 8433751.0,
1145
+ "logits/chosen": -0.7479031936089587,
1146
+ "logits/rejected": -0.660857903954597,
1147
+ "mean_token_accuracy": 0.66091203879565,
1148
+ "rewards/chosen": -0.4369000616581616,
1149
+ "rewards/rejected": -1.5926436452555937,
1150
+ "rewards/accuracies": 0.80375,
1151
+ "rewards/margins": 1.1557435841672123,
1152
+ "logps/chosen": -60.516501158475876,
1153
+ "logps/rejected": -57.770808889865876,
1154
+ "epoch": 0.6016285462372284,
1155
+ "step": 580
1156
+ },
1157
+ {
1158
+ "loss": 0.4958089828491211,
1159
+ "grad_norm": 0.014941485598683357,
1160
+ "learning_rate": 3.896373056994819e-06,
1161
+ "entropy": 1.2861195527855307,
1162
+ "num_tokens": 8580235.0,
1163
+ "logits/chosen": -0.7134623334720516,
1164
+ "logits/rejected": -0.6337572470141326,
1165
+ "mean_token_accuracy": 0.6624758186563849,
1166
+ "rewards/chosen": -0.48507625065831234,
1167
+ "rewards/rejected": -1.5025616684707348,
1168
+ "rewards/accuracies": 0.7675,
1169
+ "rewards/margins": 1.0174854172300547,
1170
+ "logps/chosen": -64.41009007811546,
1171
+ "logps/rejected": -59.815929347276686,
1172
+ "epoch": 0.6120014522068358,
1173
+ "step": 590
1174
+ },
1175
+ {
1176
+ "loss": 0.47800679206848146,
1177
+ "grad_norm": 0.01430908776819706,
1178
+ "learning_rate": 3.7927461139896377e-06,
1179
+ "entropy": 1.2737568323127926,
1180
+ "num_tokens": 8723363.0,
1181
+ "logits/chosen": -0.6718185966589912,
1182
+ "logits/rejected": -0.5801828286442322,
1183
+ "mean_token_accuracy": 0.6622481289878488,
1184
+ "rewards/chosen": -0.38251684666481195,
1185
+ "rewards/rejected": -1.4414349760363712,
1186
+ "rewards/accuracies": 0.78375,
1187
+ "rewards/margins": 1.0589181298250332,
1188
+ "logps/chosen": -59.11278188347816,
1189
+ "logps/rejected": -57.41570061087609,
1190
+ "epoch": 0.6223743581764432,
1191
+ "step": 600
1192
+ },
1193
+ {
1194
+ "loss": 0.4607038974761963,
1195
+ "grad_norm": 0.016786962747573853,
1196
+ "learning_rate": 3.6891191709844567e-06,
1197
+ "entropy": 1.3031947114598006,
1198
+ "num_tokens": 8867843.0,
1199
+ "logits/chosen": -0.660966853554005,
1200
+ "logits/rejected": -0.582685814465534,
1201
+ "mean_token_accuracy": 0.6579678988829255,
1202
+ "rewards/chosen": -0.3749055393272283,
1203
+ "rewards/rejected": -1.4482067039191133,
1204
+ "rewards/accuracies": 0.815,
1205
+ "rewards/margins": 1.0733011648245157,
1206
+ "logps/chosen": -59.77094477295876,
1207
+ "logps/rejected": -58.26709199547768,
1208
+ "epoch": 0.6327472641460505,
1209
+ "step": 610
1210
+ },
1211
+ {
1212
+ "loss": 0.4435013771057129,
1213
+ "grad_norm": 0.013243520632386208,
1214
+ "learning_rate": 3.5854922279792748e-06,
1215
+ "entropy": 1.2442782195843756,
1216
+ "num_tokens": 9012429.0,
1217
+ "logits/chosen": -0.7155245964218712,
1218
+ "logits/rejected": -0.62228141826014,
1219
+ "mean_token_accuracy": 0.6603258750028909,
1220
+ "rewards/chosen": -0.35220212864573114,
1221
+ "rewards/rejected": -1.49272357024136,
1222
+ "rewards/accuracies": 0.8175,
1223
+ "rewards/margins": 1.1405214420426637,
1224
+ "logps/chosen": -58.541049842834475,
1225
+ "logps/rejected": -57.54325157284737,
1226
+ "epoch": 0.6431201701156579,
1227
+ "step": 620
1228
+ },
1229
+ {
1230
+ "eval_loss": 0.5402435660362244,
1231
+ "eval_runtime": 293.8352,
1232
+ "eval_samples_per_second": 3.403,
1233
+ "eval_steps_per_second": 3.403,
1234
+ "eval_entropy": 0.9412421704679728,
1235
+ "eval_num_tokens": 9084893.0,
1236
+ "eval_logits/chosen": -0.2831247920504241,
1237
+ "eval_logits/rejected": -0.15805534941173774,
1238
+ "eval_mean_token_accuracy": 0.7173487603366375,
1239
+ "eval_rewards/chosen": -0.163662012138695,
1240
+ "eval_rewards/rejected": -0.6573172951535962,
1241
+ "eval_rewards/accuracies": 0.763,
1242
+ "eval_rewards/margins": 0.49365528268739584,
1243
+ "eval_logps/chosen": -51.8096069393158,
1244
+ "eval_logps/rejected": -59.21304455375672,
1245
+ "epoch": 0.6483066231004616,
1246
+ "step": 625
1247
+ },
1248
+ {
1249
+ "loss": 0.45146970748901366,
1250
+ "grad_norm": 0.011234515346586704,
1251
+ "learning_rate": 3.4818652849740937e-06,
1252
+ "entropy": 1.2889114275900646,
1253
+ "num_tokens": 9158703.0,
1254
+ "logits/chosen": -0.6542699654733424,
1255
+ "logits/rejected": -0.5822428945211472,
1256
+ "mean_token_accuracy": 0.6584817282296718,
1257
+ "rewards/chosen": -0.3719235458994808,
1258
+ "rewards/rejected": -1.5630993095623853,
1259
+ "rewards/accuracies": 0.8,
1260
+ "rewards/margins": 1.1911757623543964,
1261
+ "logps/chosen": -61.62524257659912,
1262
+ "logps/rejected": -59.77060217618942,
1263
+ "epoch": 0.6534930760852653,
1264
+ "step": 630
1265
+ },
1266
+ {
1267
+ "loss": 0.45473732948303225,
1268
+ "grad_norm": 0.01427957508713007,
1269
+ "learning_rate": 3.3782383419689123e-06,
1270
+ "entropy": 1.270301983555546,
1271
+ "num_tokens": 9303628.0,
1272
+ "logits/chosen": -0.6727831000063272,
1273
+ "logits/rejected": -0.5958556125497929,
1274
+ "mean_token_accuracy": 0.6592282411269843,
1275
+ "rewards/chosen": -0.39630664114709363,
1276
+ "rewards/rejected": -1.5085867938393493,
1277
+ "rewards/accuracies": 0.81125,
1278
+ "rewards/margins": 1.112280152433086,
1279
+ "logps/chosen": -60.25154410600662,
1280
+ "logps/rejected": -59.81609448671341,
1281
+ "epoch": 0.6638659820548727,
1282
+ "step": 640
1283
+ },
1284
+ {
1285
+ "loss": 0.4724769115447998,
1286
+ "grad_norm": 0.011104694567620754,
1287
+ "learning_rate": 3.274611398963731e-06,
1288
+ "entropy": 1.2825965376850217,
1289
+ "num_tokens": 9447859.0,
1290
+ "logits/chosen": -0.6886272934207637,
1291
+ "logits/rejected": -0.6191571248326155,
1292
+ "mean_token_accuracy": 0.657224724534899,
1293
+ "rewards/chosen": -0.39751313600787397,
1294
+ "rewards/rejected": -1.501351127484304,
1295
+ "rewards/accuracies": 0.80375,
1296
+ "rewards/margins": 1.1038379945326597,
1297
+ "logps/chosen": -61.231552537679676,
1298
+ "logps/rejected": -57.24312862277031,
1299
+ "epoch": 0.6742388880244801,
1300
+ "step": 650
1301
+ },
1302
+ {
1303
+ "loss": 0.48994994163513184,
1304
+ "grad_norm": 0.015749365091323853,
1305
+ "learning_rate": 3.1709844559585493e-06,
1306
+ "entropy": 1.2718282664287834,
1307
+ "num_tokens": 9591275.0,
1308
+ "logits/chosen": -0.7000141689252796,
1309
+ "logits/rejected": -0.6344551697912493,
1310
+ "mean_token_accuracy": 0.6556407183595002,
1311
+ "rewards/chosen": -0.3735031143521701,
1312
+ "rewards/rejected": -1.4077299095626221,
1313
+ "rewards/accuracies": 0.8075,
1314
+ "rewards/margins": 1.034226797488518,
1315
+ "logps/chosen": -60.32739723324776,
1316
+ "logps/rejected": -56.30893276691437,
1317
+ "epoch": 0.6846117939940874,
1318
+ "step": 660
1319
+ },
1320
+ {
1321
+ "loss": 0.42113280296325684,
1322
+ "grad_norm": 0.011937125585973263,
1323
+ "learning_rate": 3.0673575129533683e-06,
1324
+ "entropy": 1.27422906415537,
1325
+ "num_tokens": 9737336.0,
1326
+ "logits/chosen": -0.6675869420516058,
1327
+ "logits/rejected": -0.6171588368781001,
1328
+ "mean_token_accuracy": 0.6570126633532345,
1329
+ "rewards/chosen": -0.3044447978468088,
1330
+ "rewards/rejected": -1.5031647271365,
1331
+ "rewards/accuracies": 0.8175,
1332
+ "rewards/margins": 1.1987199306860565,
1333
+ "logps/chosen": -62.614556882381436,
1334
+ "logps/rejected": -57.67475826740265,
1335
+ "epoch": 0.6949846999636948,
1336
+ "step": 670
1337
+ },
1338
+ {
1339
+ "loss": 0.4509533405303955,
1340
+ "grad_norm": 0.014425016939640045,
1341
+ "learning_rate": 2.963730569948187e-06,
1342
+ "entropy": 1.2917946016066708,
1343
+ "num_tokens": 9884203.0,
1344
+ "logits/chosen": -0.6209272877296821,
1345
+ "logits/rejected": -0.5547300822758102,
1346
+ "mean_token_accuracy": 0.6614484623633325,
1347
+ "rewards/chosen": -0.34687376230140216,
1348
+ "rewards/rejected": -1.5009351192926987,
1349
+ "rewards/accuracies": 0.8025,
1350
+ "rewards/margins": 1.1540613523963839,
1351
+ "logps/chosen": -63.675368639230726,
1352
+ "logps/rejected": -59.546725879907605,
1353
+ "epoch": 0.7053576059333022,
1354
+ "step": 680
1355
+ },
1356
+ {
1357
+ "loss": 0.49210338592529296,
1358
+ "grad_norm": 0.01453041099011898,
1359
+ "learning_rate": 2.8601036269430053e-06,
1360
+ "entropy": 1.318970390278846,
1361
+ "num_tokens": 10030490.0,
1362
+ "logits/chosen": -0.6129511188439006,
1363
+ "logits/rejected": -0.5470711603742071,
1364
+ "mean_token_accuracy": 0.6580428531672805,
1365
+ "rewards/chosen": -0.35959291283600125,
1366
+ "rewards/rejected": -1.394242706346704,
1367
+ "rewards/accuracies": 0.80625,
1368
+ "rewards/margins": 1.0346497943252324,
1369
+ "logps/chosen": -64.7718941605091,
1370
+ "logps/rejected": -57.55288832068443,
1371
+ "epoch": 0.7157305119029096,
1372
+ "step": 690
1373
+ },
1374
+ {
1375
+ "loss": 0.4248403549194336,
1376
+ "grad_norm": 0.012130402959883213,
1377
+ "learning_rate": 2.7564766839378243e-06,
1378
+ "entropy": 1.2868076485674829,
1379
+ "num_tokens": 10175134.0,
1380
+ "logits/chosen": -0.6680388671827403,
1381
+ "logits/rejected": -0.5829757325025796,
1382
+ "mean_token_accuracy": 0.6597682436835021,
1383
+ "rewards/chosen": -0.30255757274717326,
1384
+ "rewards/rejected": -1.4632275151461362,
1385
+ "rewards/accuracies": 0.82875,
1386
+ "rewards/margins": 1.1606699449336155,
1387
+ "logps/chosen": -62.52647110342979,
1388
+ "logps/rejected": -54.934954075813295,
1389
+ "epoch": 0.726103417872517,
1390
+ "step": 700
1391
+ },
1392
+ {
1393
+ "loss": 0.46398053169250486,
1394
+ "grad_norm": 0.010899660177528858,
1395
+ "learning_rate": 2.6528497409326424e-06,
1396
+ "entropy": 1.3012964005907997,
1397
+ "num_tokens": 10321605.0,
1398
+ "logits/chosen": -0.6793537159810091,
1399
+ "logits/rejected": -0.5945389351521791,
1400
+ "mean_token_accuracy": 0.6582902568951249,
1401
+ "rewards/chosen": -0.3586843095816721,
1402
+ "rewards/rejected": -1.5040888605307554,
1403
+ "rewards/accuracies": 0.78625,
1404
+ "rewards/margins": 1.1454045504983514,
1405
+ "logps/chosen": -66.0418261361122,
1406
+ "logps/rejected": -57.98255445957184,
1407
+ "epoch": 0.7364763238421244,
1408
+ "step": 710
1409
+ },
1410
+ {
1411
+ "loss": 0.45627450942993164,
1412
+ "grad_norm": 0.015107187442481518,
1413
+ "learning_rate": 2.5492227979274614e-06,
1414
+ "entropy": 1.2992314287554472,
1415
+ "num_tokens": 10464696.0,
1416
+ "logits/chosen": -0.6788668626078029,
1417
+ "logits/rejected": -0.598369878754869,
1418
+ "mean_token_accuracy": 0.6590372899640351,
1419
+ "rewards/chosen": -0.32335921899306413,
1420
+ "rewards/rejected": -1.4580287650012178,
1421
+ "rewards/accuracies": 0.80375,
1422
+ "rewards/margins": 1.1346695464709773,
1423
+ "logps/chosen": -60.56386103153229,
1424
+ "logps/rejected": -55.05920248985291,
1425
+ "epoch": 0.7468492298117317,
1426
+ "step": 720
1427
+ },
1428
+ {
1429
+ "loss": 0.45744032859802247,
1430
+ "grad_norm": 0.015074568800628185,
1431
+ "learning_rate": 2.44559585492228e-06,
1432
+ "entropy": 1.3187106101540849,
1433
+ "num_tokens": 10611681.0,
1434
+ "logits/chosen": -0.6193487567657021,
1435
+ "logits/rejected": -0.5510364978587164,
1436
+ "mean_token_accuracy": 0.6565000848285854,
1437
+ "rewards/chosen": -0.3346571850046166,
1438
+ "rewards/rejected": -1.5139837610156974,
1439
+ "rewards/accuracies": 0.7975,
1440
+ "rewards/margins": 1.1793265779595823,
1441
+ "logps/chosen": -62.09045646429062,
1442
+ "logps/rejected": -61.43362274646759,
1443
+ "epoch": 0.7572221357813391,
1444
+ "step": 730
1445
+ },
1446
+ {
1447
+ "loss": 0.44286222457885743,
1448
+ "grad_norm": 0.01326123159378767,
1449
+ "learning_rate": 2.3419689119170984e-06,
1450
+ "entropy": 1.327558269179426,
1451
+ "num_tokens": 10756633.0,
1452
+ "logits/chosen": -0.6719882830268841,
1453
+ "logits/rejected": -0.5616402227001511,
1454
+ "mean_token_accuracy": 0.6571272361278534,
1455
+ "rewards/chosen": -0.33738715873330877,
1456
+ "rewards/rejected": -1.5023427059937966,
1457
+ "rewards/accuracies": 0.82125,
1458
+ "rewards/margins": 1.1649555454589426,
1459
+ "logps/chosen": -62.31321774363518,
1460
+ "logps/rejected": -59.3358825302124,
1461
+ "epoch": 0.7675950417509465,
1462
+ "step": 740
1463
+ },
1464
+ {
1465
+ "loss": 0.4650571823120117,
1466
+ "grad_norm": 0.0126119963824749,
1467
+ "learning_rate": 2.2383419689119174e-06,
1468
+ "entropy": 1.29965307561215,
1469
+ "num_tokens": 10905175.0,
1470
+ "logits/chosen": -0.6533030424492793,
1471
+ "logits/rejected": -0.5875300805405916,
1472
+ "mean_token_accuracy": 0.6576582338660956,
1473
+ "rewards/chosen": -0.40247532632221467,
1474
+ "rewards/rejected": -1.5875308242870414,
1475
+ "rewards/accuracies": 0.79,
1476
+ "rewards/margins": 1.1850554993841798,
1477
+ "logps/chosen": -65.17352761864662,
1478
+ "logps/rejected": -62.21493496775627,
1479
+ "epoch": 0.7779679477205539,
1480
+ "step": 750
1481
+ },
1482
+ {
1483
+ "eval_loss": 0.5359359383583069,
1484
+ "eval_runtime": 320.8935,
1485
+ "eval_samples_per_second": 3.116,
1486
+ "eval_steps_per_second": 3.116,
1487
+ "eval_entropy": 0.9404631896130741,
1488
+ "eval_num_tokens": 10905175.0,
1489
+ "eval_logits/chosen": -0.2688203306854898,
1490
+ "eval_logits/rejected": -0.1410600388922386,
1491
+ "eval_mean_token_accuracy": 0.7175761694908143,
1492
+ "eval_rewards/chosen": -0.1531370894421125,
1493
+ "eval_rewards/rejected": -0.6597482364820425,
1494
+ "eval_rewards/accuracies": 0.764,
1495
+ "eval_rewards/margins": 0.5066111467555166,
1496
+ "eval_logps/chosen": -51.70435771179199,
1497
+ "eval_logps/rejected": -59.23735397338867,
1498
+ "epoch": 0.7779679477205539,
1499
+ "step": 750
1500
+ },
1501
+ {
1502
+ "loss": 0.44441781044006345,
1503
+ "grad_norm": 0.01466372236609459,
1504
+ "learning_rate": 2.134715025906736e-06,
1505
+ "entropy": 1.28976634433493,
1506
+ "num_tokens": 11051293.0,
1507
+ "logits/chosen": -0.7179963626211149,
1508
+ "logits/rejected": -0.6301743637240872,
1509
+ "mean_token_accuracy": 0.6519320147298276,
1510
+ "rewards/chosen": -0.35903158226523374,
1511
+ "rewards/rejected": -1.4595573616991169,
1512
+ "rewards/accuracies": 0.805,
1513
+ "rewards/margins": 1.100525778569281,
1514
+ "logps/chosen": -62.626072100400926,
1515
+ "logps/rejected": -58.10015594720841,
1516
+ "epoch": 0.7883408536901613,
1517
+ "step": 760
1518
+ },
1519
+ {
1520
+ "loss": 0.4427034854888916,
1521
+ "grad_norm": 0.012671389617025852,
1522
+ "learning_rate": 2.0310880829015544e-06,
1523
+ "entropy": 1.3044293180131354,
1524
+ "num_tokens": 11200144.0,
1525
+ "logits/chosen": -0.6538815830450716,
1526
+ "logits/rejected": -0.5728917452531731,
1527
+ "mean_token_accuracy": 0.6632946115918458,
1528
+ "rewards/chosen": -0.37740983954085094,
1529
+ "rewards/rejected": -1.6017498846648959,
1530
+ "rewards/accuracies": 0.82375,
1531
+ "rewards/margins": 1.2243400452192872,
1532
+ "logps/chosen": -65.87450021147728,
1533
+ "logps/rejected": -62.50144905328751,
1534
+ "epoch": 0.7987137596597687,
1535
+ "step": 770
1536
+ },
1537
+ {
1538
+ "loss": 0.47789411544799804,
1539
+ "grad_norm": 0.014209717512130737,
1540
+ "learning_rate": 1.9274611398963734e-06,
1541
+ "entropy": 1.2642307026335038,
1542
+ "num_tokens": 11345001.0,
1543
+ "logits/chosen": -0.7598325245824121,
1544
+ "logits/rejected": -0.6345409980160763,
1545
+ "mean_token_accuracy": 0.6561008535698056,
1546
+ "rewards/chosen": -0.4101038860027188,
1547
+ "rewards/rejected": -1.5055885665896493,
1548
+ "rewards/accuracies": 0.7925,
1549
+ "rewards/margins": 1.09548467958346,
1550
+ "logps/chosen": -60.939151479005815,
1551
+ "logps/rejected": -59.33771441936493,
1552
+ "epoch": 0.809086665629376,
1553
+ "step": 780
1554
+ },
1555
+ {
1556
+ "loss": 0.45084495544433595,
1557
+ "grad_norm": 0.01159591879695654,
1558
+ "learning_rate": 1.823834196891192e-06,
1559
+ "entropy": 1.2825998100219294,
1560
+ "num_tokens": 11490957.0,
1561
+ "logits/chosen": -0.6798757077356125,
1562
+ "logits/rejected": -0.5974159600128078,
1563
+ "mean_token_accuracy": 0.6551897264830768,
1564
+ "rewards/chosen": -0.37878839314620566,
1565
+ "rewards/rejected": -1.565106635761622,
1566
+ "rewards/accuracies": 0.81125,
1567
+ "rewards/margins": 1.1863182406220585,
1568
+ "logps/chosen": -62.11761864900589,
1569
+ "logps/rejected": -58.61645050764084,
1570
+ "epoch": 0.8194595715989834,
1571
+ "step": 790
1572
+ },
1573
+ {
1574
+ "loss": 0.4757333278656006,
1575
+ "grad_norm": 0.01929500699043274,
1576
+ "learning_rate": 1.7202072538860104e-06,
1577
+ "entropy": 1.3137290544318967,
1578
+ "num_tokens": 11635952.0,
1579
+ "logits/chosen": -0.7116650574710064,
1580
+ "logits/rejected": -0.6434065148170602,
1581
+ "mean_token_accuracy": 0.6526090941950679,
1582
+ "rewards/chosen": -0.39931287897430595,
1583
+ "rewards/rejected": -1.51923489038134,
1584
+ "rewards/accuracies": 0.80625,
1585
+ "rewards/margins": 1.119922012281604,
1586
+ "logps/chosen": -63.77980515360832,
1587
+ "logps/rejected": -58.51232698440552,
1588
+ "epoch": 0.8298324775685908,
1589
+ "step": 800
1590
+ },
1591
+ {
1592
+ "loss": 0.4533553600311279,
1593
+ "grad_norm": 0.011488179676234722,
1594
+ "learning_rate": 1.6165803108808292e-06,
1595
+ "entropy": 1.2781752744410186,
1596
+ "num_tokens": 11781419.0,
1597
+ "logits/chosen": -0.7322858283680784,
1598
+ "logits/rejected": -0.6704393794115492,
1599
+ "mean_token_accuracy": 0.6515787079930305,
1600
+ "rewards/chosen": -0.3753399283361523,
1601
+ "rewards/rejected": -1.5520857451565098,
1602
+ "rewards/accuracies": 0.805,
1603
+ "rewards/margins": 1.1767458136426285,
1604
+ "logps/chosen": -62.6512784576416,
1605
+ "logps/rejected": -59.1226301574707,
1606
+ "epoch": 0.8402053835381982,
1607
+ "step": 810
1608
+ },
1609
+ {
1610
+ "loss": 0.459058952331543,
1611
+ "grad_norm": 0.010664924047887325,
1612
+ "learning_rate": 1.5129533678756477e-06,
1613
+ "entropy": 1.2839164751721546,
1614
+ "num_tokens": 11926234.0,
1615
+ "logits/chosen": -0.668114556411545,
1616
+ "logits/rejected": -0.6314948882239511,
1617
+ "mean_token_accuracy": 0.6545133054628969,
1618
+ "rewards/chosen": -0.3676813648158713,
1619
+ "rewards/rejected": -1.5132245452463393,
1620
+ "rewards/accuracies": 0.815,
1621
+ "rewards/margins": 1.145543181069661,
1622
+ "logps/chosen": -63.80598108768463,
1623
+ "logps/rejected": -57.3190500497818,
1624
+ "epoch": 0.8505782895078056,
1625
+ "step": 820
1626
+ },
1627
+ {
1628
+ "loss": 0.45433964729309084,
1629
+ "grad_norm": 0.013902204111218452,
1630
+ "learning_rate": 1.4093264248704663e-06,
1631
+ "entropy": 1.2906162818288431,
1632
+ "num_tokens": 12071032.0,
1633
+ "logits/chosen": -0.6819364086266573,
1634
+ "logits/rejected": -0.5817802480567199,
1635
+ "mean_token_accuracy": 0.6650253617018461,
1636
+ "rewards/chosen": -0.3574298277559137,
1637
+ "rewards/rejected": -1.5355529067799216,
1638
+ "rewards/accuracies": 0.82125,
1639
+ "rewards/margins": 1.1781230779876932,
1640
+ "logps/chosen": -59.579396767616274,
1641
+ "logps/rejected": -58.291543385982514,
1642
+ "epoch": 0.860951195477413,
1643
+ "step": 830
1644
+ },
1645
+ {
1646
+ "loss": 0.43956761360168456,
1647
+ "grad_norm": 0.017366426065564156,
1648
+ "learning_rate": 1.3056994818652852e-06,
1649
+ "entropy": 1.3188584124017506,
1650
+ "num_tokens": 12216650.0,
1651
+ "logits/chosen": -0.6219026821907607,
1652
+ "logits/rejected": -0.5560462281839198,
1653
+ "mean_token_accuracy": 0.6576781215891242,
1654
+ "rewards/chosen": -0.3260511834644603,
1655
+ "rewards/rejected": -1.558354403564008,
1656
+ "rewards/accuracies": 0.80625,
1657
+ "rewards/margins": 1.2323032197169959,
1658
+ "logps/chosen": -64.06994863152504,
1659
+ "logps/rejected": -58.97870760083199,
1660
+ "epoch": 0.8713241014470204,
1661
+ "step": 840
1662
+ },
1663
+ {
1664
+ "loss": 0.46459689140319826,
1665
+ "grad_norm": 0.012618121691048145,
1666
+ "learning_rate": 1.2020725388601037e-06,
1667
+ "entropy": 1.315548148807138,
1668
+ "num_tokens": 12362070.0,
1669
+ "logits/chosen": -0.6251195627372872,
1670
+ "logits/rejected": -0.5604575453557197,
1671
+ "mean_token_accuracy": 0.6604597151651979,
1672
+ "rewards/chosen": -0.3555148102169187,
1673
+ "rewards/rejected": -1.5313407544395887,
1674
+ "rewards/accuracies": 0.79625,
1675
+ "rewards/margins": 1.1758259430155158,
1676
+ "logps/chosen": -62.78060804247856,
1677
+ "logps/rejected": -58.929887549877165,
1678
+ "epoch": 0.8816970074166278,
1679
+ "step": 850
1680
+ },
1681
+ {
1682
+ "loss": 0.44550557136535646,
1683
+ "grad_norm": 0.013532118871808052,
1684
+ "learning_rate": 1.0984455958549225e-06,
1685
+ "entropy": 1.3122669545235113,
1686
+ "num_tokens": 12509338.0,
1687
+ "logits/chosen": -0.6126990686398949,
1688
+ "logits/rejected": -0.5539581104426821,
1689
+ "mean_token_accuracy": 0.6569988044165075,
1690
+ "rewards/chosen": -0.38766197150049264,
1691
+ "rewards/rejected": -1.5939512548525818,
1692
+ "rewards/accuracies": 0.81875,
1693
+ "rewards/margins": 1.2062892844853923,
1694
+ "logps/chosen": -65.91424354076385,
1695
+ "logps/rejected": -59.84309137582779,
1696
+ "epoch": 0.8920699133862352,
1697
+ "step": 860
1698
+ },
1699
+ {
1700
+ "loss": 0.44367341995239257,
1701
+ "grad_norm": 0.014622218906879425,
1702
+ "learning_rate": 9.94818652849741e-07,
1703
+ "entropy": 1.29490221851971,
1704
+ "num_tokens": 12656013.0,
1705
+ "logits/chosen": -0.6367152223575993,
1706
+ "logits/rejected": -0.5619754576335303,
1707
+ "mean_token_accuracy": 0.6582811014540494,
1708
+ "rewards/chosen": -0.3575555875984719,
1709
+ "rewards/rejected": -1.485135663910769,
1710
+ "rewards/accuracies": 0.81625,
1711
+ "rewards/margins": 1.1275800754828378,
1712
+ "logps/chosen": -64.74992589473725,
1713
+ "logps/rejected": -58.28154501080513,
1714
+ "epoch": 0.9024428193558426,
1715
+ "step": 870
1716
+ },
1717
+ {
1718
+ "eval_loss": 0.5303567051887512,
1719
+ "eval_runtime": 351.9964,
1720
+ "eval_samples_per_second": 2.841,
1721
+ "eval_steps_per_second": 2.841,
1722
+ "eval_entropy": 0.9427960855923593,
1723
+ "eval_num_tokens": 12728578.0,
1724
+ "eval_logits/chosen": -0.26863109543646074,
1725
+ "eval_logits/rejected": -0.13725877180195847,
1726
+ "eval_mean_token_accuracy": 0.7159041211903096,
1727
+ "eval_rewards/chosen": -0.17772461017644672,
1728
+ "eval_rewards/rejected": -0.7113549838000909,
1729
+ "eval_rewards/accuracies": 0.763,
1730
+ "eval_rewards/margins": 0.5336303729685024,
1731
+ "eval_logps/chosen": -51.95023292160034,
1732
+ "eval_logps/rejected": -59.75342144203186,
1733
+ "epoch": 0.9076292723406463,
1734
+ "step": 875
1735
+ },
1736
+ {
1737
+ "loss": 0.42188777923583987,
1738
+ "grad_norm": 0.014083835296332836,
1739
+ "learning_rate": 8.911917098445596e-07,
1740
+ "entropy": 1.2842787204217165,
1741
+ "num_tokens": 12801884.0,
1742
+ "logits/chosen": -0.6543839594717639,
1743
+ "logits/rejected": -0.5576565805204583,
1744
+ "mean_token_accuracy": 0.6647658421378583,
1745
+ "rewards/chosen": -0.32246251756288985,
1746
+ "rewards/rejected": -1.561580713846779,
1747
+ "rewards/accuracies": 0.825,
1748
+ "rewards/margins": 1.2391181947570293,
1749
+ "logps/chosen": -60.62016844153404,
1750
+ "logps/rejected": -60.981985919475555,
1751
+ "epoch": 0.91281572532545,
1752
+ "step": 880
1753
+ },
1754
+ {
1755
+ "loss": 0.4861095905303955,
1756
+ "grad_norm": 0.01509900763630867,
1757
+ "learning_rate": 7.875647668393784e-07,
1758
+ "entropy": 1.2736156480619685,
1759
+ "num_tokens": 12946912.0,
1760
+ "logits/chosen": -0.7128123134940787,
1761
+ "logits/rejected": -0.6054497727959169,
1762
+ "mean_token_accuracy": 0.6572731367498637,
1763
+ "rewards/chosen": -0.4675049069095985,
1764
+ "rewards/rejected": -1.5612919216800947,
1765
+ "rewards/accuracies": 0.7825,
1766
+ "rewards/margins": 1.0937870144005866,
1767
+ "logps/chosen": -61.985627712011336,
1768
+ "logps/rejected": -60.579013855457305,
1769
+ "epoch": 0.9231886312950573,
1770
+ "step": 890
1771
+ },
1772
+ {
1773
+ "loss": 0.43419761657714845,
1774
+ "grad_norm": 0.014685068279504776,
1775
+ "learning_rate": 6.839378238341969e-07,
1776
+ "entropy": 1.2819190438790247,
1777
+ "num_tokens": 13093558.0,
1778
+ "logits/chosen": -0.6502587498062717,
1779
+ "logits/rejected": -0.5614254849582602,
1780
+ "mean_token_accuracy": 0.6592135391384363,
1781
+ "rewards/chosen": -0.36472693517142035,
1782
+ "rewards/rejected": -1.6288802374559601,
1783
+ "rewards/accuracies": 0.82,
1784
+ "rewards/margins": 1.2641532999722402,
1785
+ "logps/chosen": -61.57865165352821,
1786
+ "logps/rejected": -62.50596989512444,
1787
+ "epoch": 0.9335615372646647,
1788
+ "step": 900
1789
+ },
1790
+ {
1791
+ "loss": 0.4454813003540039,
1792
+ "grad_norm": 0.011209873482584953,
1793
+ "learning_rate": 5.803108808290156e-07,
1794
+ "entropy": 1.3184868184709921,
1795
+ "num_tokens": 13239740.0,
1796
+ "logits/chosen": -0.6909169377714659,
1797
+ "logits/rejected": -0.601211010607464,
1798
+ "mean_token_accuracy": 0.6575440725311636,
1799
+ "rewards/chosen": -0.36972430324880406,
1800
+ "rewards/rejected": -1.6006858524744165,
1801
+ "rewards/accuracies": 0.82875,
1802
+ "rewards/margins": 1.2309615502599627,
1803
+ "logps/chosen": -63.300528687238696,
1804
+ "logps/rejected": -60.001617946624755,
1805
+ "epoch": 0.9439344432342721,
1806
+ "step": 910
1807
+ },
1808
+ {
1809
+ "loss": 0.4595484733581543,
1810
+ "grad_norm": 0.010628749616444111,
1811
+ "learning_rate": 4.7668393782383424e-07,
1812
+ "entropy": 1.271923498995602,
1813
+ "num_tokens": 13383045.0,
1814
+ "logits/chosen": -0.7072264696856618,
1815
+ "logits/rejected": -0.6024060889326301,
1816
+ "mean_token_accuracy": 0.6569805011339486,
1817
+ "rewards/chosen": -0.3887278968687133,
1818
+ "rewards/rejected": -1.5501526693382766,
1819
+ "rewards/accuracies": 0.815,
1820
+ "rewards/margins": 1.1614247707859613,
1821
+ "logps/chosen": -60.07761764883995,
1822
+ "logps/rejected": -56.95813281774521,
1823
+ "epoch": 0.9543073492038795,
1824
+ "step": 920
1825
+ },
1826
+ {
1827
+ "loss": 0.4529257297515869,
1828
+ "grad_norm": 0.014489009976387024,
1829
+ "learning_rate": 3.730569948186528e-07,
1830
+ "entropy": 1.2988391564786435,
1831
+ "num_tokens": 13530054.0,
1832
+ "logits/chosen": -0.7166704098766242,
1833
+ "logits/rejected": -0.6650401865166429,
1834
+ "mean_token_accuracy": 0.6520283976197243,
1835
+ "rewards/chosen": -0.4043681784943692,
1836
+ "rewards/rejected": -1.5586467561577593,
1837
+ "rewards/accuracies": 0.81875,
1838
+ "rewards/margins": 1.1542785764392465,
1839
+ "logps/chosen": -64.28691901445389,
1840
+ "logps/rejected": -60.51436370611191,
1841
+ "epoch": 0.9646802551734869,
1842
+ "step": 930
1843
+ },
1844
+ {
1845
+ "loss": 0.4493688106536865,
1846
+ "grad_norm": 0.0122548658400774,
1847
+ "learning_rate": 2.694300518134715e-07,
1848
+ "entropy": 1.293265828914009,
1849
+ "num_tokens": 13676771.0,
1850
+ "logits/chosen": -0.638114123144128,
1851
+ "logits/rejected": -0.6033606771543887,
1852
+ "mean_token_accuracy": 0.6584486217796802,
1853
+ "rewards/chosen": -0.353517619818158,
1854
+ "rewards/rejected": -1.4791943001397885,
1855
+ "rewards/accuracies": 0.82625,
1856
+ "rewards/margins": 1.1256766823492945,
1857
+ "logps/chosen": -63.997545466423034,
1858
+ "logps/rejected": -58.525367016792295,
1859
+ "epoch": 0.9750531611430943,
1860
+ "step": 940
1861
+ },
1862
+ {
1863
+ "loss": 0.46651930809020997,
1864
+ "grad_norm": 0.01745172217488289,
1865
+ "learning_rate": 1.6580310880829015e-07,
1866
+ "entropy": 1.2602451098989695,
1867
+ "num_tokens": 13822091.0,
1868
+ "logits/chosen": -0.7271677677940491,
1869
+ "logits/rejected": -0.6540065888305867,
1870
+ "mean_token_accuracy": 0.6601362200826406,
1871
+ "rewards/chosen": -0.40040454823116306,
1872
+ "rewards/rejected": -1.5421940996023478,
1873
+ "rewards/accuracies": 0.80125,
1874
+ "rewards/margins": 1.141789550515823,
1875
+ "logps/chosen": -61.94225021719932,
1876
+ "logps/rejected": -58.28781437397003,
1877
+ "epoch": 0.9854260671127016,
1878
+ "step": 950
1879
+ },
1880
+ {
1881
+ "loss": 0.46761231422424315,
1882
+ "grad_norm": 0.012348760850727558,
1883
+ "learning_rate": 6.217616580310881e-08,
1884
+ "entropy": 1.2971244535176083,
1885
+ "num_tokens": 13969713.0,
1886
+ "logits/chosen": -0.6472266813048246,
1887
+ "logits/rejected": -0.5813531516986534,
1888
+ "mean_token_accuracy": 0.6541070010513067,
1889
+ "rewards/chosen": -0.4221547889366411,
1890
+ "rewards/rejected": -1.5586294095951598,
1891
+ "rewards/accuracies": 0.7925,
1892
+ "rewards/margins": 1.1364746230933815,
1893
+ "logps/chosen": -64.67578131318092,
1894
+ "logps/rejected": -59.52407863378525,
1895
+ "epoch": 0.995798973082309,
1896
+ "step": 960
1897
+ },
1898
+ {
1899
+ "train_runtime": 22000.2483,
1900
+ "train_samples_per_second": 3.506,
1901
+ "train_steps_per_second": 0.044,
1902
+ "total_flos": 1.2331818072769536e+17,
1903
+ "train_loss": 0.4788281094842624,
1904
+ "entropy": 1.3463219977616343,
1905
+ "num_tokens": 14029916.0,
1906
+ "logits/chosen": -0.5587557057517026,
1907
+ "logits/rejected": -0.5043508288937856,
1908
+ "mean_token_accuracy": 0.6551804588072829,
1909
+ "rewards/chosen": -0.42263167897738046,
1910
+ "rewards/rejected": -1.5862010600171799,
1911
+ "rewards/accuracies": 0.8148148148148148,
1912
+ "rewards/margins": 1.163569376240542,
1913
+ "logps/chosen": -66.20575960182849,
1914
+ "logps/rejected": -63.83122500666865,
1915
+ "epoch": 1.0,
1916
+ "step": 965
1917
+ }
1918
+ ],
1919
+ "validation_monitor_size": 1000,
1920
+ "validation_monitor_selection": "fixed_seed_random_without_replacement",
1921
+ "validation_monitor_seed": 22,
1922
+ "validation_monitor_indices": [
1923
+ 2,
1924
+ 10,
1925
+ 14,
1926
+ 21,
1927
+ 55,
1928
+ 63,
1929
+ 66,
1930
+ 69,
1931
+ 107,
1932
+ 110,
1933
+ 142,
1934
+ 144,
1935
+ 149,
1936
+ 150,
1937
+ 151,
1938
+ 152,
1939
+ 160,
1940
+ 163,
1941
+ 166,
1942
+ 167,
1943
+ 176,
1944
+ 181,
1945
+ 206,
1946
+ 207,
1947
+ 259,
1948
+ 267,
1949
+ 281,
1950
+ 295,
1951
+ 298,
1952
+ 306,
1953
+ 307,
1954
+ 317,
1955
+ 321,
1956
+ 331,
1957
+ 336,
1958
+ 341,
1959
+ 346,
1960
+ 349,
1961
+ 351,
1962
+ 352,
1963
+ 357,
1964
+ 358,
1965
+ 369,
1966
+ 370,
1967
+ 382,
1968
+ 386,
1969
+ 391,
1970
+ 401,
1971
+ 411,
1972
+ 412,
1973
+ 432,
1974
+ 437,
1975
+ 452,
1976
+ 462,
1977
+ 465,
1978
+ 488,
1979
+ 490,
1980
+ 491,
1981
+ 492,
1982
+ 494,
1983
+ 503,
1984
+ 504,
1985
+ 508,
1986
+ 528,
1987
+ 538,
1988
+ 540,
1989
+ 551,
1990
+ 553,
1991
+ 567,
1992
+ 586,
1993
+ 605,
1994
+ 606,
1995
+ 625,
1996
+ 627,
1997
+ 661,
1998
+ 663,
1999
+ 666,
2000
+ 677,
2001
+ 685,
2002
+ 690,
2003
+ 692,
2004
+ 704,
2005
+ 708,
2006
+ 714,
2007
+ 715,
2008
+ 727,
2009
+ 728,
2010
+ 733,
2011
+ 745,
2012
+ 752,
2013
+ 753,
2014
+ 755,
2015
+ 764,
2016
+ 773,
2017
+ 779,
2018
+ 783,
2019
+ 793,
2020
+ 796,
2021
+ 799,
2022
+ 803,
2023
+ 804,
2024
+ 805,
2025
+ 813,
2026
+ 816,
2027
+ 818,
2028
+ 823,
2029
+ 827,
2030
+ 829,
2031
+ 830,
2032
+ 837,
2033
+ 842,
2034
+ 845,
2035
+ 850,
2036
+ 853,
2037
+ 856,
2038
+ 889,
2039
+ 890,
2040
+ 905,
2041
+ 915,
2042
+ 924,
2043
+ 930,
2044
+ 939,
2045
+ 951,
2046
+ 988,
2047
+ 1002,
2048
+ 1005,
2049
+ 1023,
2050
+ 1029,
2051
+ 1038,
2052
+ 1049,
2053
+ 1050,
2054
+ 1054,
2055
+ 1056,
2056
+ 1067,
2057
+ 1068,
2058
+ 1079,
2059
+ 1088,
2060
+ 1091,
2061
+ 1103,
2062
+ 1114,
2063
+ 1118,
2064
+ 1133,
2065
+ 1140,
2066
+ 1144,
2067
+ 1145,
2068
+ 1155,
2069
+ 1186,
2070
+ 1195,
2071
+ 1206,
2072
+ 1223,
2073
+ 1251,
2074
+ 1252,
2075
+ 1257,
2076
+ 1259,
2077
+ 1270,
2078
+ 1271,
2079
+ 1295,
2080
+ 1303,
2081
+ 1304,
2082
+ 1305,
2083
+ 1329,
2084
+ 1335,
2085
+ 1336,
2086
+ 1343,
2087
+ 1367,
2088
+ 1373,
2089
+ 1377,
2090
+ 1403,
2091
+ 1412,
2092
+ 1429,
2093
+ 1443,
2094
+ 1457,
2095
+ 1459,
2096
+ 1460,
2097
+ 1476,
2098
+ 1483,
2099
+ 1486,
2100
+ 1494,
2101
+ 1507,
2102
+ 1510,
2103
+ 1519,
2104
+ 1521,
2105
+ 1522,
2106
+ 1545,
2107
+ 1551,
2108
+ 1570,
2109
+ 1582,
2110
+ 1593,
2111
+ 1595,
2112
+ 1603,
2113
+ 1607,
2114
+ 1614,
2115
+ 1615,
2116
+ 1625,
2117
+ 1634,
2118
+ 1639,
2119
+ 1648,
2120
+ 1654,
2121
+ 1657,
2122
+ 1662,
2123
+ 1667,
2124
+ 1673,
2125
+ 1690,
2126
+ 1704,
2127
+ 1746,
2128
+ 1756,
2129
+ 1781,
2130
+ 1783,
2131
+ 1796,
2132
+ 1799,
2133
+ 1809,
2134
+ 1814,
2135
+ 1827,
2136
+ 1829,
2137
+ 1832,
2138
+ 1844,
2139
+ 1847,
2140
+ 1854,
2141
+ 1856,
2142
+ 1857,
2143
+ 1858,
2144
+ 1874,
2145
+ 1883,
2146
+ 1889,
2147
+ 1924,
2148
+ 1925,
2149
+ 1931,
2150
+ 1932,
2151
+ 1934,
2152
+ 1935,
2153
+ 1938,
2154
+ 1950,
2155
+ 1957,
2156
+ 1962,
2157
+ 1967,
2158
+ 1975,
2159
+ 1982,
2160
+ 1983,
2161
+ 1991,
2162
+ 1998,
2163
+ 2003,
2164
+ 2008,
2165
+ 2017,
2166
+ 2021,
2167
+ 2026,
2168
+ 2035,
2169
+ 2040,
2170
+ 2050,
2171
+ 2056,
2172
+ 2077,
2173
+ 2079,
2174
+ 2082,
2175
+ 2098,
2176
+ 2100,
2177
+ 2108,
2178
+ 2121,
2179
+ 2130,
2180
+ 2133,
2181
+ 2134,
2182
+ 2138,
2183
+ 2143,
2184
+ 2166,
2185
+ 2167,
2186
+ 2180,
2187
+ 2181,
2188
+ 2185,
2189
+ 2204,
2190
+ 2205,
2191
+ 2212,
2192
+ 2221,
2193
+ 2224,
2194
+ 2226,
2195
+ 2230,
2196
+ 2233,
2197
+ 2256,
2198
+ 2261,
2199
+ 2263,
2200
+ 2269,
2201
+ 2273,
2202
+ 2290,
2203
+ 2291,
2204
+ 2299,
2205
+ 2301,
2206
+ 2321,
2207
+ 2323,
2208
+ 2330,
2209
+ 2384,
2210
+ 2401,
2211
+ 2417,
2212
+ 2420,
2213
+ 2421,
2214
+ 2424,
2215
+ 2430,
2216
+ 2435,
2217
+ 2456,
2218
+ 2488,
2219
+ 2502,
2220
+ 2504,
2221
+ 2519,
2222
+ 2527,
2223
+ 2532,
2224
+ 2538,
2225
+ 2542,
2226
+ 2553,
2227
+ 2555,
2228
+ 2558,
2229
+ 2559,
2230
+ 2562,
2231
+ 2578,
2232
+ 2583,
2233
+ 2585,
2234
+ 2590,
2235
+ 2592,
2236
+ 2594,
2237
+ 2596,
2238
+ 2600,
2239
+ 2606,
2240
+ 2607,
2241
+ 2618,
2242
+ 2630,
2243
+ 2637,
2244
+ 2647,
2245
+ 2650,
2246
+ 2657,
2247
+ 2679,
2248
+ 2685,
2249
+ 2705,
2250
+ 2706,
2251
+ 2712,
2252
+ 2713,
2253
+ 2714,
2254
+ 2727,
2255
+ 2740,
2256
+ 2742,
2257
+ 2755,
2258
+ 2780,
2259
+ 2784,
2260
+ 2792,
2261
+ 2807,
2262
+ 2808,
2263
+ 2810,
2264
+ 2820,
2265
+ 2831,
2266
+ 2839,
2267
+ 2860,
2268
+ 2862,
2269
+ 2863,
2270
+ 2866,
2271
+ 2875,
2272
+ 2878,
2273
+ 2898,
2274
+ 2905,
2275
+ 2921,
2276
+ 2922,
2277
+ 2926,
2278
+ 2930,
2279
+ 2934,
2280
+ 2944,
2281
+ 2955,
2282
+ 2957,
2283
+ 2959,
2284
+ 2973,
2285
+ 2978,
2286
+ 2998,
2287
+ 3018,
2288
+ 3022,
2289
+ 3028,
2290
+ 3031,
2291
+ 3061,
2292
+ 3085,
2293
+ 3090,
2294
+ 3104,
2295
+ 3105,
2296
+ 3111,
2297
+ 3115,
2298
+ 3121,
2299
+ 3122,
2300
+ 3129,
2301
+ 3133,
2302
+ 3135,
2303
+ 3161,
2304
+ 3162,
2305
+ 3169,
2306
+ 3173,
2307
+ 3194,
2308
+ 3195,
2309
+ 3215,
2310
+ 3225,
2311
+ 3226,
2312
+ 3241,
2313
+ 3247,
2314
+ 3250,
2315
+ 3253,
2316
+ 3265,
2317
+ 3268,
2318
+ 3293,
2319
+ 3301,
2320
+ 3312,
2321
+ 3329,
2322
+ 3352,
2323
+ 3361,
2324
+ 3362,
2325
+ 3376,
2326
+ 3396,
2327
+ 3401,
2328
+ 3403,
2329
+ 3410,
2330
+ 3419,
2331
+ 3432,
2332
+ 3443,
2333
+ 3452,
2334
+ 3467,
2335
+ 3469,
2336
+ 3475,
2337
+ 3485,
2338
+ 3503,
2339
+ 3514,
2340
+ 3515,
2341
+ 3524,
2342
+ 3528,
2343
+ 3538,
2344
+ 3544,
2345
+ 3557,
2346
+ 3560,
2347
+ 3565,
2348
+ 3600,
2349
+ 3637,
2350
+ 3642,
2351
+ 3658,
2352
+ 3659,
2353
+ 3692,
2354
+ 3693,
2355
+ 3699,
2356
+ 3722,
2357
+ 3725,
2358
+ 3728,
2359
+ 3731,
2360
+ 3740,
2361
+ 3742,
2362
+ 3762,
2363
+ 3766,
2364
+ 3780,
2365
+ 3788,
2366
+ 3794,
2367
+ 3796,
2368
+ 3798,
2369
+ 3805,
2370
+ 3817,
2371
+ 3819,
2372
+ 3822,
2373
+ 3837,
2374
+ 3839,
2375
+ 3843,
2376
+ 3846,
2377
+ 3851,
2378
+ 3854,
2379
+ 3865,
2380
+ 3870,
2381
+ 3871,
2382
+ 3884,
2383
+ 3894,
2384
+ 3895,
2385
+ 3896,
2386
+ 3907,
2387
+ 3911,
2388
+ 3915,
2389
+ 3919,
2390
+ 3920,
2391
+ 3923,
2392
+ 3933,
2393
+ 3955,
2394
+ 3967,
2395
+ 3972,
2396
+ 3974,
2397
+ 3975,
2398
+ 3984,
2399
+ 3985,
2400
+ 3997,
2401
+ 4002,
2402
+ 4010,
2403
+ 4034,
2404
+ 4044,
2405
+ 4063,
2406
+ 4073,
2407
+ 4079,
2408
+ 4082,
2409
+ 4088,
2410
+ 4121,
2411
+ 4145,
2412
+ 4148,
2413
+ 4159,
2414
+ 4161,
2415
+ 4164,
2416
+ 4177,
2417
+ 4188,
2418
+ 4199,
2419
+ 4203,
2420
+ 4207,
2421
+ 4208,
2422
+ 4213,
2423
+ 4221,
2424
+ 4225,
2425
+ 4233,
2426
+ 4241,
2427
+ 4243,
2428
+ 4247,
2429
+ 4264,
2430
+ 4274,
2431
+ 4282,
2432
+ 4286,
2433
+ 4290,
2434
+ 4308,
2435
+ 4310,
2436
+ 4313,
2437
+ 4321,
2438
+ 4324,
2439
+ 4327,
2440
+ 4349,
2441
+ 4362,
2442
+ 4370,
2443
+ 4374,
2444
+ 4380,
2445
+ 4407,
2446
+ 4409,
2447
+ 4411,
2448
+ 4415,
2449
+ 4417,
2450
+ 4418,
2451
+ 4427,
2452
+ 4431,
2453
+ 4433,
2454
+ 4451,
2455
+ 4466,
2456
+ 4477,
2457
+ 4478,
2458
+ 4479,
2459
+ 4493,
2460
+ 4494,
2461
+ 4514,
2462
+ 4527,
2463
+ 4539,
2464
+ 4550,
2465
+ 4558,
2466
+ 4568,
2467
+ 4579,
2468
+ 4583,
2469
+ 4584,
2470
+ 4586,
2471
+ 4587,
2472
+ 4590,
2473
+ 4599,
2474
+ 4602,
2475
+ 4610,
2476
+ 4626,
2477
+ 4627,
2478
+ 4630,
2479
+ 4641,
2480
+ 4647,
2481
+ 4655,
2482
+ 4656,
2483
+ 4657,
2484
+ 4661,
2485
+ 4685,
2486
+ 4714,
2487
+ 4715,
2488
+ 4731,
2489
+ 4749,
2490
+ 4752,
2491
+ 4769,
2492
+ 4777,
2493
+ 4782,
2494
+ 4791,
2495
+ 4805,
2496
+ 4818,
2497
+ 4829,
2498
+ 4833,
2499
+ 4837,
2500
+ 4839,
2501
+ 4843,
2502
+ 4871,
2503
+ 4875,
2504
+ 4879,
2505
+ 4880,
2506
+ 4885,
2507
+ 4888,
2508
+ 4895,
2509
+ 4900,
2510
+ 4923,
2511
+ 4966,
2512
+ 4968,
2513
+ 4972,
2514
+ 4989,
2515
+ 4994,
2516
+ 4998,
2517
+ 5001,
2518
+ 5013,
2519
+ 5019,
2520
+ 5026,
2521
+ 5032,
2522
+ 5034,
2523
+ 5046,
2524
+ 5055,
2525
+ 5085,
2526
+ 5086,
2527
+ 5088,
2528
+ 5089,
2529
+ 5090,
2530
+ 5095,
2531
+ 5108,
2532
+ 5110,
2533
+ 5119,
2534
+ 5120,
2535
+ 5121,
2536
+ 5133,
2537
+ 5148,
2538
+ 5154,
2539
+ 5160,
2540
+ 5169,
2541
+ 5178,
2542
+ 5222,
2543
+ 5223,
2544
+ 5232,
2545
+ 5233,
2546
+ 5240,
2547
+ 5256,
2548
+ 5259,
2549
+ 5264,
2550
+ 5271,
2551
+ 5276,
2552
+ 5279,
2553
+ 5294,
2554
+ 5300,
2555
+ 5303,
2556
+ 5321,
2557
+ 5335,
2558
+ 5337,
2559
+ 5345,
2560
+ 5348,
2561
+ 5365,
2562
+ 5373,
2563
+ 5378,
2564
+ 5384,
2565
+ 5422,
2566
+ 5442,
2567
+ 5443,
2568
+ 5445,
2569
+ 5477,
2570
+ 5485,
2571
+ 5495,
2572
+ 5497,
2573
+ 5504,
2574
+ 5526,
2575
+ 5533,
2576
+ 5542,
2577
+ 5564,
2578
+ 5570,
2579
+ 5579,
2580
+ 5587,
2581
+ 5592,
2582
+ 5608,
2583
+ 5610,
2584
+ 5624,
2585
+ 5630,
2586
+ 5638,
2587
+ 5651,
2588
+ 5663,
2589
+ 5670,
2590
+ 5675,
2591
+ 5691,
2592
+ 5700,
2593
+ 5706,
2594
+ 5707,
2595
+ 5715,
2596
+ 5720,
2597
+ 5721,
2598
+ 5722,
2599
+ 5732,
2600
+ 5738,
2601
+ 5741,
2602
+ 5769,
2603
+ 5771,
2604
+ 5775,
2605
+ 5795,
2606
+ 5796,
2607
+ 5800,
2608
+ 5809,
2609
+ 5810,
2610
+ 5815,
2611
+ 5819,
2612
+ 5827,
2613
+ 5848,
2614
+ 5849,
2615
+ 5852,
2616
+ 5859,
2617
+ 5880,
2618
+ 5884,
2619
+ 5907,
2620
+ 5909,
2621
+ 5912,
2622
+ 5919,
2623
+ 5931,
2624
+ 5932,
2625
+ 5934,
2626
+ 5941,
2627
+ 5948,
2628
+ 5950,
2629
+ 5952,
2630
+ 5953,
2631
+ 5969,
2632
+ 5981,
2633
+ 6000,
2634
+ 6003,
2635
+ 6010,
2636
+ 6018,
2637
+ 6041,
2638
+ 6065,
2639
+ 6075,
2640
+ 6090,
2641
+ 6103,
2642
+ 6106,
2643
+ 6109,
2644
+ 6114,
2645
+ 6123,
2646
+ 6131,
2647
+ 6136,
2648
+ 6138,
2649
+ 6139,
2650
+ 6164,
2651
+ 6165,
2652
+ 6171,
2653
+ 6173,
2654
+ 6180,
2655
+ 6185,
2656
+ 6189,
2657
+ 6190,
2658
+ 6221,
2659
+ 6223,
2660
+ 6237,
2661
+ 6255,
2662
+ 6262,
2663
+ 6265,
2664
+ 6293,
2665
+ 6296,
2666
+ 6305,
2667
+ 6318,
2668
+ 6331,
2669
+ 6336,
2670
+ 6340,
2671
+ 6355,
2672
+ 6366,
2673
+ 6371,
2674
+ 6396,
2675
+ 6399,
2676
+ 6402,
2677
+ 6408,
2678
+ 6432,
2679
+ 6433,
2680
+ 6441,
2681
+ 6456,
2682
+ 6465,
2683
+ 6478,
2684
+ 6486,
2685
+ 6489,
2686
+ 6507,
2687
+ 6508,
2688
+ 6520,
2689
+ 6522,
2690
+ 6528,
2691
+ 6537,
2692
+ 6551,
2693
+ 6564,
2694
+ 6589,
2695
+ 6590,
2696
+ 6598,
2697
+ 6599,
2698
+ 6611,
2699
+ 6613,
2700
+ 6615,
2701
+ 6621,
2702
+ 6634,
2703
+ 6647,
2704
+ 6649,
2705
+ 6654,
2706
+ 6676,
2707
+ 6680,
2708
+ 6690,
2709
+ 6708,
2710
+ 6729,
2711
+ 6736,
2712
+ 6744,
2713
+ 6749,
2714
+ 6756,
2715
+ 6761,
2716
+ 6763,
2717
+ 6773,
2718
+ 6788,
2719
+ 6790,
2720
+ 6796,
2721
+ 6797,
2722
+ 6811,
2723
+ 6824,
2724
+ 6850,
2725
+ 6869,
2726
+ 6871,
2727
+ 6882,
2728
+ 6892,
2729
+ 6895,
2730
+ 6906,
2731
+ 6911,
2732
+ 6912,
2733
+ 6914,
2734
+ 6927,
2735
+ 6952,
2736
+ 6966,
2737
+ 6985,
2738
+ 7001,
2739
+ 7021,
2740
+ 7031,
2741
+ 7035,
2742
+ 7038,
2743
+ 7041,
2744
+ 7045,
2745
+ 7052,
2746
+ 7057,
2747
+ 7058,
2748
+ 7072,
2749
+ 7073,
2750
+ 7076,
2751
+ 7086,
2752
+ 7102,
2753
+ 7107,
2754
+ 7109,
2755
+ 7117,
2756
+ 7122,
2757
+ 7125,
2758
+ 7166,
2759
+ 7182,
2760
+ 7199,
2761
+ 7207,
2762
+ 7212,
2763
+ 7215,
2764
+ 7232,
2765
+ 7243,
2766
+ 7246,
2767
+ 7250,
2768
+ 7253,
2769
+ 7258,
2770
+ 7263,
2771
+ 7267,
2772
+ 7270,
2773
+ 7274,
2774
+ 7280,
2775
+ 7286,
2776
+ 7293,
2777
+ 7298,
2778
+ 7302,
2779
+ 7306,
2780
+ 7316,
2781
+ 7325,
2782
+ 7326,
2783
+ 7334,
2784
+ 7356,
2785
+ 7357,
2786
+ 7363,
2787
+ 7364,
2788
+ 7367,
2789
+ 7385,
2790
+ 7392,
2791
+ 7399,
2792
+ 7405,
2793
+ 7416,
2794
+ 7420,
2795
+ 7421,
2796
+ 7426,
2797
+ 7452,
2798
+ 7476,
2799
+ 7481,
2800
+ 7519,
2801
+ 7534,
2802
+ 7542,
2803
+ 7546,
2804
+ 7573,
2805
+ 7585,
2806
+ 7601,
2807
+ 7604,
2808
+ 7606,
2809
+ 7609,
2810
+ 7629,
2811
+ 7649,
2812
+ 7653,
2813
+ 7667,
2814
+ 7682,
2815
+ 7699,
2816
+ 7738,
2817
+ 7750,
2818
+ 7786,
2819
+ 7798,
2820
+ 7800,
2821
+ 7801,
2822
+ 7805,
2823
+ 7806,
2824
+ 7811,
2825
+ 7813,
2826
+ 7832,
2827
+ 7837,
2828
+ 7849,
2829
+ 7856,
2830
+ 7876,
2831
+ 7877,
2832
+ 7887,
2833
+ 7905,
2834
+ 7916,
2835
+ 7919,
2836
+ 7920,
2837
+ 7922,
2838
+ 7923,
2839
+ 7926,
2840
+ 7944,
2841
+ 7961,
2842
+ 7966,
2843
+ 7970,
2844
+ 7973,
2845
+ 7974,
2846
+ 7976,
2847
+ 7986,
2848
+ 7999,
2849
+ 8027,
2850
+ 8028,
2851
+ 8034,
2852
+ 8047,
2853
+ 8068,
2854
+ 8074,
2855
+ 8077,
2856
+ 8091,
2857
+ 8120,
2858
+ 8122,
2859
+ 8125,
2860
+ 8152,
2861
+ 8153,
2862
+ 8164,
2863
+ 8167,
2864
+ 8169,
2865
+ 8171,
2866
+ 8177,
2867
+ 8184,
2868
+ 8189,
2869
+ 8192,
2870
+ 8196,
2871
+ 8202,
2872
+ 8212,
2873
+ 8217,
2874
+ 8231,
2875
+ 8242,
2876
+ 8244,
2877
+ 8250,
2878
+ 8256,
2879
+ 8257,
2880
+ 8265,
2881
+ 8270,
2882
+ 8274,
2883
+ 8283,
2884
+ 8290,
2885
+ 8294,
2886
+ 8301,
2887
+ 8302,
2888
+ 8307,
2889
+ 8318,
2890
+ 8326,
2891
+ 8338,
2892
+ 8349,
2893
+ 8350,
2894
+ 8353,
2895
+ 8357,
2896
+ 8371,
2897
+ 8374,
2898
+ 8377,
2899
+ 8380,
2900
+ 8387,
2901
+ 8388,
2902
+ 8396,
2903
+ 8402,
2904
+ 8419,
2905
+ 8423,
2906
+ 8428,
2907
+ 8435,
2908
+ 8439,
2909
+ 8442,
2910
+ 8444,
2911
+ 8453,
2912
+ 8461,
2913
+ 8475,
2914
+ 8481,
2915
+ 8485,
2916
+ 8493,
2917
+ 8495,
2918
+ 8498,
2919
+ 8523,
2920
+ 8530,
2921
+ 8531,
2922
+ 8562
2923
+ ],
2924
+ "early_stopping_patience": 3
2925
+ }
phase1/ablations/random_labels/README.md ADDED
@@ -0,0 +1,80 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: peft
3
+ model_name: phase1-qwen-random-labels-ablation
4
+ tags:
5
+ - base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct
6
+ - dpo
7
+ - lora
8
+ - transformers
9
+ - trl
10
+ license: apache-2.0
11
+ base_model: Qwen/Qwen2.5-1.5B-Instruct
12
+ pipeline_tag: text-generation
13
+ ---
14
+
15
+ # Phase 1 Qwen `random_labels` diagnostic ablation
16
+
17
+ This is the Phase 1 `random_labels` diagnostic LoRA-DPO adapter fine-tuned from
18
+ [Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct).
19
+ The frozen training recipe and membership hashes are included in this directory.
20
+
21
+ ## Quick start
22
+
23
+ ```python
24
+ from peft import PeftModel
25
+ from transformers import AutoModelForCausalLM, AutoTokenizer
26
+
27
+ repo_id = "geyuxu/york-milestone-project-self-traing-loop-model"
28
+ subfolder = "phase1/ablations/random_labels"
29
+ base_id = "Qwen/Qwen2.5-1.5B-Instruct"
30
+
31
+ tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder)
32
+ base_model = AutoModelForCausalLM.from_pretrained(
33
+ base_id, torch_dtype="auto", device_map="auto"
34
+ )
35
+ model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder)
36
+ ```
37
+
38
+ ## Training procedure
39
+
40
+
41
+
42
+
43
+
44
+ This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290).
45
+
46
+ ### Framework versions
47
+
48
+ - PEFT 0.18.1
49
+ - TRL: 0.29.0
50
+ - Transformers: 5.3.0
51
+ - Pytorch: 2.10.0
52
+ - Datasets: 4.6.1
53
+ - Tokenizers: 0.22.2
54
+
55
+ ## Citations
56
+
57
+ Cite DPO as:
58
+
59
+ ```bibtex
60
+ @inproceedings{rafailov2023direct,
61
+ title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}},
62
+ author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn},
63
+ year = 2023,
64
+ booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023},
65
+ url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html},
66
+ editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine},
67
+ }
68
+ ```
69
+
70
+ Cite TRL as:
71
+
72
+ ```bibtex
73
+ @software{vonwerra2020trl,
74
+ title = {{TRL: Transformers Reinforcement Learning}},
75
+ author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin},
76
+ license = {Apache-2.0},
77
+ url = {https://github.com/huggingface/trl},
78
+ year = {2020}
79
+ }
80
+ ```
phase1/ablations/random_labels/adapter_config.json ADDED
@@ -0,0 +1,43 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 32,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "megatron_config": null,
23
+ "megatron_core": "megatron.core",
24
+ "modules_to_save": null,
25
+ "peft_type": "LORA",
26
+ "peft_version": "0.18.1",
27
+ "qalora_group_size": 16,
28
+ "r": 16,
29
+ "rank_pattern": {},
30
+ "revision": null,
31
+ "target_modules": [
32
+ "v_proj",
33
+ "k_proj",
34
+ "o_proj",
35
+ "q_proj"
36
+ ],
37
+ "target_parameters": null,
38
+ "task_type": "CAUSAL_LM",
39
+ "trainable_token_indices": null,
40
+ "use_dora": false,
41
+ "use_qalora": false,
42
+ "use_rslora": false
43
+ }
phase1/ablations/random_labels/adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7bebded9e10f63603bfd9d6a135dda87c8bcac25b4a43b365e2b1ce882bf4c93
3
+ size 17462432
phase1/ablations/random_labels/chat_template.jinja ADDED
@@ -0,0 +1,54 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0]['role'] == 'system' %}
4
+ {{- messages[0]['content'] }}
5
+ {%- else %}
6
+ {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }}
7
+ {%- endif %}
8
+ {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
9
+ {%- for tool in tools %}
10
+ {{- "\n" }}
11
+ {{- tool | tojson }}
12
+ {%- endfor %}
13
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
14
+ {%- else %}
15
+ {%- if messages[0]['role'] == 'system' %}
16
+ {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }}
17
+ {%- else %}
18
+ {{- '<|im_start|>system\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\n' }}
19
+ {%- endif %}
20
+ {%- endif %}
21
+ {%- for message in messages %}
22
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %}
23
+ {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
24
+ {%- elif message.role == "assistant" %}
25
+ {{- '<|im_start|>' + message.role }}
26
+ {%- if message.content %}
27
+ {{- '\n' + message.content }}
28
+ {%- endif %}
29
+ {%- for tool_call in message.tool_calls %}
30
+ {%- if tool_call.function is defined %}
31
+ {%- set tool_call = tool_call.function %}
32
+ {%- endif %}
33
+ {{- '\n<tool_call>\n{"name": "' }}
34
+ {{- tool_call.name }}
35
+ {{- '", "arguments": ' }}
36
+ {{- tool_call.arguments | tojson }}
37
+ {{- '}\n</tool_call>' }}
38
+ {%- endfor %}
39
+ {{- '<|im_end|>\n' }}
40
+ {%- elif message.role == "tool" %}
41
+ {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %}
42
+ {{- '<|im_start|>user' }}
43
+ {%- endif %}
44
+ {{- '\n<tool_response>\n' }}
45
+ {{- message.content }}
46
+ {{- '\n</tool_response>' }}
47
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
48
+ {{- '<|im_end|>\n' }}
49
+ {%- endif %}
50
+ {%- endif %}
51
+ {%- endfor %}
52
+ {%- if add_generation_prompt %}
53
+ {{- '<|im_start|>assistant\n' }}
54
+ {%- endif %}
phase1/ablations/random_labels/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6b4360dd6a184650ffc48056c2569bc603f896c5adfe94b10f1c79f809638aa5
3
+ size 11422166
phase1/ablations/random_labels/tokenizer_config.json ADDED
@@ -0,0 +1,29 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": null,
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "errors": "replace",
8
+ "extra_special_tokens": [
9
+ "<|im_start|>",
10
+ "<|im_end|>",
11
+ "<|object_ref_start|>",
12
+ "<|object_ref_end|>",
13
+ "<|box_start|>",
14
+ "<|box_end|>",
15
+ "<|quad_start|>",
16
+ "<|quad_end|>",
17
+ "<|vision_start|>",
18
+ "<|vision_end|>",
19
+ "<|vision_pad|>",
20
+ "<|image_pad|>",
21
+ "<|video_pad|>"
22
+ ],
23
+ "is_local": true,
24
+ "model_max_length": 131072,
25
+ "pad_token": "<|endoftext|>",
26
+ "split_special_tokens": false,
27
+ "tokenizer_class": "Qwen2Tokenizer",
28
+ "unk_token": null
29
+ }
phase1/ablations/random_labels/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ad84a00370d0c977fcd38a1fce033b130494f3fffd4a3c0cbc44a9dd43c0bdbf
3
+ size 5841
phase1/ablations/random_labels/training_recipe.json ADDED
@@ -0,0 +1,22 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "format_version": 1,
3
+ "experiment": "confusion_ablation",
4
+ "ablation": "random_labels",
5
+ "model_name": "Qwen/Qwen2.5-1.5B-Instruct",
6
+ "train_membership_sha256": "b497fa765223a9810ad784f31e1598edfa992a162146d6f94d9cdf4adcedd87d",
7
+ "validation_membership_sha256": "2f609467438cd6a01fd84b9d80c0fcd84c44767e3b2ed98f4f6a83d68a62c181",
8
+ "num_train_pairs": 77124,
9
+ "num_validation_pairs": 8563,
10
+ "transformation_seed": 22,
11
+ "validation_prompt_mode": "clean_rag",
12
+ "learning_rate": 1e-05,
13
+ "beta": 0.1,
14
+ "num_epochs": 1.0,
15
+ "seed": 22,
16
+ "max_length": 512,
17
+ "max_prompt_length": 384,
18
+ "gradient_accumulation_steps": 80,
19
+ "save_steps": 125,
20
+ "save_total_limit": 12,
21
+ "preference_pairs_format_version": 2
22
+ }
phase1/ablations/random_labels/training_summary.json ADDED
@@ -0,0 +1,2517 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_name": "Qwen/Qwen2.5-1.5B-Instruct",
3
+ "resolved_model": "Qwen/Qwen2.5-1.5B-Instruct",
4
+ "num_train_records": 77124,
5
+ "num_validation_records_available": 8563,
6
+ "training_config": {
7
+ "lora_rank": 16,
8
+ "lora_alpha": 32,
9
+ "learning_rate": 1e-05,
10
+ "num_epochs": 1.0,
11
+ "per_device_batch_size": 1,
12
+ "per_device_eval_batch_size": 1,
13
+ "gradient_accumulation_steps": 80,
14
+ "beta": 0.1,
15
+ "max_length": 512,
16
+ "max_prompt_length": 384,
17
+ "seed": 22,
18
+ "save_steps": 125,
19
+ "save_total_limit": 12,
20
+ "resume_from_checkpoint": null,
21
+ "precision_dtype": "torch.bfloat16",
22
+ "bf16": true,
23
+ "fp16": false,
24
+ "tokenizer_add_bos_token": false
25
+ },
26
+ "global_step": 750,
27
+ "best_metric": 0.6905523538589478,
28
+ "best_model_checkpoint": "outputs/confusion_ablation_phase1_repair_v3/random_labels/lora/checkpoint-375",
29
+ "train_metrics": {
30
+ "train_runtime": 27561.1083,
31
+ "train_samples_per_second": 2.798,
32
+ "train_steps_per_second": 0.035,
33
+ "total_flos": 4.075839588886364e+17,
34
+ "train_loss": 0.6933243910471598
35
+ },
36
+ "log_history": [
37
+ {
38
+ "loss": 0.6934387683868408,
39
+ "grad_norm": 0.009266729466617107,
40
+ "learning_rate": 9.906735751295338e-06,
41
+ "entropy": 0.8080450683785603,
42
+ "num_tokens": 669528.0,
43
+ "logits/chosen": -0.9213643590964665,
44
+ "logits/rejected": -0.9683298173272368,
45
+ "mean_token_accuracy": 0.7228609627112746,
46
+ "rewards/chosen": 0.0007450232512769616,
47
+ "rewards/rejected": 0.001045633094436198,
48
+ "rewards/accuracies": 0.44,
49
+ "rewards/margins": -0.0003006098522382672,
50
+ "logps/chosen": -51.68650775671005,
51
+ "logps/rejected": -50.719243061542514,
52
+ "epoch": 0.010372905969607386,
53
+ "step": 10
54
+ },
55
+ {
56
+ "loss": 0.6930126190185547,
57
+ "grad_norm": 0.009303063154220581,
58
+ "learning_rate": 9.803108808290156e-06,
59
+ "entropy": 0.7915201940061525,
60
+ "num_tokens": 1338759.0,
61
+ "logits/chosen": -0.9846059676325559,
62
+ "logits/rejected": -0.9714732527595322,
63
+ "mean_token_accuracy": 0.7229587784409524,
64
+ "rewards/chosen": -0.00012686825164792025,
65
+ "rewards/rejected": -0.0007469337083875871,
66
+ "rewards/accuracies": 0.48625,
67
+ "rewards/margins": 0.0006200655033171643,
68
+ "logps/chosen": -50.57927699804306,
69
+ "logps/rejected": -51.70512897491455,
70
+ "epoch": 0.02074581193921477,
71
+ "step": 20
72
+ },
73
+ {
74
+ "loss": 0.693855619430542,
75
+ "grad_norm": 0.009770886041224003,
76
+ "learning_rate": 9.699481865284975e-06,
77
+ "entropy": 0.8051797628332861,
78
+ "num_tokens": 2009918.0,
79
+ "logits/chosen": -1.0153866272103405,
80
+ "logits/rejected": -0.9948517174473516,
81
+ "mean_token_accuracy": 0.7255033986549825,
82
+ "rewards/chosen": 0.000551955679097773,
83
+ "rewards/rejected": 0.0015872831797685194,
84
+ "rewards/accuracies": 0.495,
85
+ "rewards/margins": -0.0010353274924636935,
86
+ "logps/chosen": -51.339062130451204,
87
+ "logps/rejected": -52.78074060201645,
88
+ "epoch": 0.031118717908822157,
89
+ "step": 30
90
+ },
91
+ {
92
+ "loss": 0.69316725730896,
93
+ "grad_norm": 0.008510654792189598,
94
+ "learning_rate": 9.595854922279793e-06,
95
+ "entropy": 0.7799565396877006,
96
+ "num_tokens": 2680367.0,
97
+ "logits/chosen": -1.0400407581404876,
98
+ "logits/rejected": -0.9926833103096355,
99
+ "mean_token_accuracy": 0.7316536229476333,
100
+ "rewards/chosen": 0.0013948245377036982,
101
+ "rewards/rejected": 0.001106869012758125,
102
+ "rewards/accuracies": 0.4775,
103
+ "rewards/margins": 0.0002879555685285595,
104
+ "logps/chosen": -50.836872832775114,
105
+ "logps/rejected": -52.290282304286954,
106
+ "epoch": 0.04149162387842954,
107
+ "step": 40
108
+ },
109
+ {
110
+ "loss": 0.6937148094177246,
111
+ "grad_norm": 0.00940113328397274,
112
+ "learning_rate": 9.492227979274612e-06,
113
+ "entropy": 0.784734519557096,
114
+ "num_tokens": 3350695.0,
115
+ "logits/chosen": -1.0085622581752787,
116
+ "logits/rejected": -0.9717813104276766,
117
+ "mean_token_accuracy": 0.7277172536216676,
118
+ "rewards/chosen": 0.0007200987445082774,
119
+ "rewards/rejected": 0.001504770267456479,
120
+ "rewards/accuracies": 0.495,
121
+ "rewards/margins": -0.0007846715349296573,
122
+ "logps/chosen": -50.88885704755783,
123
+ "logps/rejected": -51.595236620903016,
124
+ "epoch": 0.051864529848036925,
125
+ "step": 50
126
+ },
127
+ {
128
+ "loss": 0.6925368785858155,
129
+ "grad_norm": 0.01000447291880846,
130
+ "learning_rate": 9.388601036269432e-06,
131
+ "entropy": 0.7792391402181238,
132
+ "num_tokens": 4019867.0,
133
+ "logits/chosen": -0.989283063151833,
134
+ "logits/rejected": -0.9758414097701983,
135
+ "mean_token_accuracy": 0.7253596894256771,
136
+ "rewards/chosen": 0.00419369634595455,
137
+ "rewards/rejected": 0.00261573103512319,
138
+ "rewards/accuracies": 0.515,
139
+ "rewards/margins": 0.0015779653389472515,
140
+ "logps/chosen": -50.12135502576828,
141
+ "logps/rejected": -49.72630759477615,
142
+ "epoch": 0.062237435817644314,
143
+ "step": 60
144
+ },
145
+ {
146
+ "loss": 0.6928633213043213,
147
+ "grad_norm": 0.008523018099367619,
148
+ "learning_rate": 9.284974093264249e-06,
149
+ "entropy": 0.7859808096196502,
150
+ "num_tokens": 4689830.0,
151
+ "logits/chosen": -0.9542620254422428,
152
+ "logits/rejected": -0.9723457128166635,
153
+ "mean_token_accuracy": 0.7191485194861889,
154
+ "rewards/chosen": 0.006607790327220755,
155
+ "rewards/rejected": 0.005695816857155478,
156
+ "rewards/accuracies": 0.50625,
157
+ "rewards/margins": 0.0009119734441992478,
158
+ "logps/chosen": -52.69678068399429,
159
+ "logps/rejected": -49.40951271772385,
160
+ "epoch": 0.0726103417872517,
161
+ "step": 70
162
+ },
163
+ {
164
+ "loss": 0.6931606769561768,
165
+ "grad_norm": 0.009254093281924725,
166
+ "learning_rate": 9.181347150259067e-06,
167
+ "entropy": 0.8076216962421313,
168
+ "num_tokens": 5359790.0,
169
+ "logits/chosen": -0.9293808590029637,
170
+ "logits/rejected": -0.9847294370574589,
171
+ "mean_token_accuracy": 0.7200651096645743,
172
+ "rewards/chosen": 0.011739555572351037,
173
+ "rewards/rejected": 0.011363767318175632,
174
+ "rewards/accuracies": 0.4875,
175
+ "rewards/margins": 0.00037578820330963936,
176
+ "logps/chosen": -51.38067405223846,
177
+ "logps/rejected": -50.72847024202347,
178
+ "epoch": 0.08298324775685909,
179
+ "step": 80
180
+ },
181
+ {
182
+ "loss": 0.6942155361175537,
183
+ "grad_norm": 0.008851570077240467,
184
+ "learning_rate": 9.077720207253888e-06,
185
+ "entropy": 0.8039566927566193,
186
+ "num_tokens": 6029642.0,
187
+ "logits/chosen": -0.9478755777728227,
188
+ "logits/rejected": -0.9763882057133852,
189
+ "mean_token_accuracy": 0.7233742567896843,
190
+ "rewards/chosen": 0.01409353660361603,
191
+ "rewards/rejected": 0.015802892130523674,
192
+ "rewards/accuracies": 0.48375,
193
+ "rewards/margins": -0.001709355540224351,
194
+ "logps/chosen": -51.33848252058029,
195
+ "logps/rejected": -52.321811312437056,
196
+ "epoch": 0.09335615372646647,
197
+ "step": 90
198
+ },
199
+ {
200
+ "loss": 0.6936118602752686,
201
+ "grad_norm": 0.009475240483880043,
202
+ "learning_rate": 8.974093264248706e-06,
203
+ "entropy": 0.8324551365058869,
204
+ "num_tokens": 6703750.0,
205
+ "logits/chosen": -0.9270073968773294,
206
+ "logits/rejected": -0.9359207155608903,
207
+ "mean_token_accuracy": 0.7229399124160409,
208
+ "rewards/chosen": 0.014994417404241176,
209
+ "rewards/rejected": 0.015462831489760163,
210
+ "rewards/accuracies": 0.49625,
211
+ "rewards/margins": -0.0004684141512552742,
212
+ "logps/chosen": -55.6720170044899,
213
+ "logps/rejected": -56.016610951423644,
214
+ "epoch": 0.10372905969607385,
215
+ "step": 100
216
+ },
217
+ {
218
+ "loss": 0.6934245586395263,
219
+ "grad_norm": 0.008504034951329231,
220
+ "learning_rate": 8.870466321243523e-06,
221
+ "entropy": 0.7861935871373862,
222
+ "num_tokens": 7374932.0,
223
+ "logits/chosen": -0.965592457466306,
224
+ "logits/rejected": -0.9543162182972067,
225
+ "mean_token_accuracy": 0.7248496604338288,
226
+ "rewards/chosen": 0.016234664240764685,
227
+ "rewards/rejected": 0.016324117717140468,
228
+ "rewards/accuracies": 0.495,
229
+ "rewards/margins": -8.945348919951357e-05,
230
+ "logps/chosen": -50.975947844982144,
231
+ "logps/rejected": -51.70058757305145,
232
+ "epoch": 0.11410196566568125,
233
+ "step": 110
234
+ },
235
+ {
236
+ "loss": 0.6940177917480469,
237
+ "grad_norm": 0.009204786270856857,
238
+ "learning_rate": 8.766839378238343e-06,
239
+ "entropy": 0.7727768113883212,
240
+ "num_tokens": 8045025.0,
241
+ "logits/chosen": -1.03487960348445,
242
+ "logits/rejected": -0.9815775502270385,
243
+ "mean_token_accuracy": 0.7311673213727772,
244
+ "rewards/chosen": 0.01172756811563886,
245
+ "rewards/rejected": 0.01306509348746431,
246
+ "rewards/accuracies": 0.47875,
247
+ "rewards/margins": -0.0013375253186222835,
248
+ "logps/chosen": -49.14816425204277,
249
+ "logps/rejected": -51.98841401100159,
250
+ "epoch": 0.12447487163528863,
251
+ "step": 120
252
+ },
253
+ {
254
+ "eval_loss": 0.6955941319465637,
255
+ "eval_runtime": 196.5871,
256
+ "eval_samples_per_second": 5.087,
257
+ "eval_steps_per_second": 5.087,
258
+ "eval_entropy": 0.8034458611719311,
259
+ "eval_num_tokens": 8380297.0,
260
+ "eval_logits/chosen": -0.991135582788011,
261
+ "eval_logits/rejected": -0.950536454501934,
262
+ "eval_mean_token_accuracy": 0.7337288541048765,
263
+ "eval_rewards/chosen": 0.008104163538169359,
264
+ "eval_rewards/rejected": 0.01258701845750079,
265
+ "eval_rewards/accuracies": 0.437,
266
+ "eval_rewards/margins": -0.0044828549473313615,
267
+ "eval_logps/chosen": -50.09194520950317,
268
+ "eval_logps/rejected": -52.51400153923035,
269
+ "epoch": 0.1296613246200923,
270
+ "step": 125
271
+ },
272
+ {
273
+ "loss": 0.6930018901824951,
274
+ "grad_norm": 0.00838699284940958,
275
+ "learning_rate": 8.663212435233162e-06,
276
+ "entropy": 0.8142909701773897,
277
+ "num_tokens": 8716283.0,
278
+ "logits/chosen": -0.971143901841604,
279
+ "logits/rejected": -1.0017587172299427,
280
+ "mean_token_accuracy": 0.729599024951458,
281
+ "rewards/chosen": 0.009170935571445398,
282
+ "rewards/rejected": 0.008475723866073964,
283
+ "rewards/accuracies": 0.52375,
284
+ "rewards/margins": 0.0006952117068431108,
285
+ "logps/chosen": -51.31078794002533,
286
+ "logps/rejected": -53.1062014913559,
287
+ "epoch": 0.13484777760489602,
288
+ "step": 130
289
+ },
290
+ {
291
+ "loss": 0.6927727699279785,
292
+ "grad_norm": 0.009330841712653637,
293
+ "learning_rate": 8.55958549222798e-06,
294
+ "entropy": 0.7786517775012181,
295
+ "num_tokens": 9385323.0,
296
+ "logits/chosen": -1.0336392573752233,
297
+ "logits/rejected": -1.019804302735747,
298
+ "mean_token_accuracy": 0.7317706294171512,
299
+ "rewards/chosen": 0.004249347767993186,
300
+ "rewards/rejected": 0.0031492145435004205,
301
+ "rewards/accuracies": 0.51875,
302
+ "rewards/margins": 0.001100133234722307,
303
+ "logps/chosen": -48.82712723731995,
304
+ "logps/rejected": -49.81842919588089,
305
+ "epoch": 0.1452206835745034,
306
+ "step": 140
307
+ },
308
+ {
309
+ "loss": 0.6928228378295899,
310
+ "grad_norm": 0.009226374328136444,
311
+ "learning_rate": 8.455958549222799e-06,
312
+ "entropy": 0.7707585748913698,
313
+ "num_tokens": 10057097.0,
314
+ "logits/chosen": -1.0021628340641857,
315
+ "logits/rejected": -1.0272578388562763,
316
+ "mean_token_accuracy": 0.7250917989574373,
317
+ "rewards/chosen": 0.0021179335123679265,
318
+ "rewards/rejected": 0.0010407016340150221,
319
+ "rewards/accuracies": 0.51875,
320
+ "rewards/margins": 0.0010772318854651531,
321
+ "logps/chosen": -50.82353290557862,
322
+ "logps/rejected": -51.57363982439041,
323
+ "epoch": 0.1555935895441108,
324
+ "step": 150
325
+ },
326
+ {
327
+ "loss": 0.6935010433197022,
328
+ "grad_norm": 0.008547156117856503,
329
+ "learning_rate": 8.352331606217617e-06,
330
+ "entropy": 0.8095202751364559,
331
+ "num_tokens": 10728653.0,
332
+ "logits/chosen": -0.9613099360765643,
333
+ "logits/rejected": -0.9753560247735856,
334
+ "mean_token_accuracy": 0.726740376483649,
335
+ "rewards/chosen": 0.003875704376255271,
336
+ "rewards/rejected": 0.004182930276788284,
337
+ "rewards/accuracies": 0.48375,
338
+ "rewards/margins": -0.00030722589199285724,
339
+ "logps/chosen": -53.913278470039366,
340
+ "logps/rejected": -53.74137356996536,
341
+ "epoch": 0.16596649551371817,
342
+ "step": 160
343
+ },
344
+ {
345
+ "loss": 0.6931381702423096,
346
+ "grad_norm": 0.008811748586595058,
347
+ "learning_rate": 8.248704663212436e-06,
348
+ "entropy": 0.8115301547432319,
349
+ "num_tokens": 11400551.0,
350
+ "logits/chosen": -0.9568430709542813,
351
+ "logits/rejected": -0.9675442470577922,
352
+ "mean_token_accuracy": 0.7244884933158755,
353
+ "rewards/chosen": 0.003357977192756607,
354
+ "rewards/rejected": 0.0028972053575580504,
355
+ "rewards/accuracies": 0.4925,
356
+ "rewards/margins": 0.00046077182138105856,
357
+ "logps/chosen": -53.2519864654541,
358
+ "logps/rejected": -52.62679670572281,
359
+ "epoch": 0.17633940148332555,
360
+ "step": 170
361
+ },
362
+ {
363
+ "loss": 0.6925437927246094,
364
+ "grad_norm": 0.00891165155917406,
365
+ "learning_rate": 8.145077720207254e-06,
366
+ "entropy": 0.79428493458312,
367
+ "num_tokens": 12070305.0,
368
+ "logits/chosen": -0.9719879220022611,
369
+ "logits/rejected": -0.9580149375927722,
370
+ "mean_token_accuracy": 0.7303908407129347,
371
+ "rewards/chosen": 0.002974712664896515,
372
+ "rewards/rejected": 0.0013871385961903115,
373
+ "rewards/accuracies": 0.5275,
374
+ "rewards/margins": 0.0015875740901537937,
375
+ "logps/chosen": -52.03131418466568,
376
+ "logps/rejected": -49.467778403759006,
377
+ "epoch": 0.18671230745293294,
378
+ "step": 180
379
+ },
380
+ {
381
+ "loss": 0.6946820259094239,
382
+ "grad_norm": 0.011048010550439358,
383
+ "learning_rate": 8.041450777202073e-06,
384
+ "entropy": 0.801795727997087,
385
+ "num_tokens": 12738966.0,
386
+ "logits/chosen": -0.9541037205291851,
387
+ "logits/rejected": -0.9584797920583412,
388
+ "mean_token_accuracy": 0.7201638549566269,
389
+ "rewards/chosen": 0.004079287395195053,
390
+ "rewards/rejected": 0.006725511867425666,
391
+ "rewards/accuracies": 0.47,
392
+ "rewards/margins": -0.0026462244295544224,
393
+ "logps/chosen": -51.030084483623504,
394
+ "logps/rejected": -52.38975264072418,
395
+ "epoch": 0.19708521342254032,
396
+ "step": 190
397
+ },
398
+ {
399
+ "loss": 0.6930304050445557,
400
+ "grad_norm": 0.009633849374949932,
401
+ "learning_rate": 7.937823834196891e-06,
402
+ "entropy": 0.7963748186221347,
403
+ "num_tokens": 13408002.0,
404
+ "logits/chosen": -0.9894887990110749,
405
+ "logits/rejected": -0.9980301170848317,
406
+ "mean_token_accuracy": 0.7193645982630551,
407
+ "rewards/chosen": 0.0047459728431940105,
408
+ "rewards/rejected": 0.004120458228130701,
409
+ "rewards/accuracies": 0.48625,
410
+ "rewards/margins": 0.000625514651183039,
411
+ "logps/chosen": -50.538159133195876,
412
+ "logps/rejected": -50.48108030319214,
413
+ "epoch": 0.2074581193921477,
414
+ "step": 200
415
+ },
416
+ {
417
+ "loss": 0.6936575412750244,
418
+ "grad_norm": 0.008548871614038944,
419
+ "learning_rate": 7.834196891191712e-06,
420
+ "entropy": 0.7598572969343513,
421
+ "num_tokens": 14074115.0,
422
+ "logits/chosen": -1.045821409259606,
423
+ "logits/rejected": -0.999601151613033,
424
+ "mean_token_accuracy": 0.7357131129689515,
425
+ "rewards/chosen": 0.005255431280912717,
426
+ "rewards/rejected": 0.005940479632897677,
427
+ "rewards/accuracies": 0.47,
428
+ "rewards/margins": -0.0006850483406742569,
429
+ "logps/chosen": -46.40404602527619,
430
+ "logps/rejected": -50.13248352050781,
431
+ "epoch": 0.2178310253617551,
432
+ "step": 210
433
+ },
434
+ {
435
+ "loss": 0.6938835144042969,
436
+ "grad_norm": 0.009261125698685646,
437
+ "learning_rate": 7.730569948186528e-06,
438
+ "entropy": 0.767732237551827,
439
+ "num_tokens": 14745903.0,
440
+ "logits/chosen": -1.0030631508707841,
441
+ "logits/rejected": -1.0114240661200429,
442
+ "mean_token_accuracy": 0.7297109466791153,
443
+ "rewards/chosen": 0.004763001757364691,
444
+ "rewards/rejected": 0.005841993642383727,
445
+ "rewards/accuracies": 0.49125,
446
+ "rewards/margins": -0.0010789919237868162,
447
+ "logps/chosen": -51.14548614025116,
448
+ "logps/rejected": -50.2862161898613,
449
+ "epoch": 0.2282039313313625,
450
+ "step": 220
451
+ },
452
+ {
453
+ "loss": 0.6946812152862549,
454
+ "grad_norm": 0.009788029827177525,
455
+ "learning_rate": 7.626943005181348e-06,
456
+ "entropy": 0.8289732250571251,
457
+ "num_tokens": 15418570.0,
458
+ "logits/chosen": -0.9488809894056489,
459
+ "logits/rejected": -1.0089717702518306,
460
+ "mean_token_accuracy": 0.7215882153064013,
461
+ "rewards/chosen": 0.006585003775003315,
462
+ "rewards/rejected": 0.009181454044451129,
463
+ "rewards/accuracies": 0.47625,
464
+ "rewards/margins": -0.0025964502768329113,
465
+ "logps/chosen": -56.4708499455452,
466
+ "logps/rejected": -53.11574334859848,
467
+ "epoch": 0.23857683730096987,
468
+ "step": 230
469
+ },
470
+ {
471
+ "loss": 0.6926135063171387,
472
+ "grad_norm": 0.009469996206462383,
473
+ "learning_rate": 7.523316062176167e-06,
474
+ "entropy": 0.8170388517202809,
475
+ "num_tokens": 16089276.0,
476
+ "logits/chosen": -0.9783852286633136,
477
+ "logits/rejected": -0.9603607895142418,
478
+ "mean_token_accuracy": 0.7241931633278728,
479
+ "rewards/chosen": 0.00405766910489433,
480
+ "rewards/rejected": 0.0026022558279692022,
481
+ "rewards/accuracies": 0.5175,
482
+ "rewards/margins": 0.00145541326062812,
483
+ "logps/chosen": -51.54288928151131,
484
+ "logps/rejected": -54.08886151790619,
485
+ "epoch": 0.24894974327057726,
486
+ "step": 240
487
+ },
488
+ {
489
+ "loss": 0.6937024593353271,
490
+ "grad_norm": 0.009117631241679192,
491
+ "learning_rate": 7.419689119170985e-06,
492
+ "entropy": 0.8002800923399627,
493
+ "num_tokens": 16760081.0,
494
+ "logits/chosen": -1.0175496722318613,
495
+ "logits/rejected": -0.9702955326900312,
496
+ "mean_token_accuracy": 0.7222046358138323,
497
+ "rewards/chosen": 0.0016811337291983363,
498
+ "rewards/rejected": 0.0023915858741713693,
499
+ "rewards/accuracies": 0.50625,
500
+ "rewards/margins": -0.0007104521640576422,
501
+ "logps/chosen": -51.49065291881561,
502
+ "logps/rejected": -54.3223114323616,
503
+ "epoch": 0.2593226492401846,
504
+ "step": 250
505
+ },
506
+ {
507
+ "eval_loss": 0.6968227624893188,
508
+ "eval_runtime": 223.7572,
509
+ "eval_samples_per_second": 4.469,
510
+ "eval_steps_per_second": 4.469,
511
+ "eval_entropy": 0.8013349784091115,
512
+ "eval_num_tokens": 16760081.0,
513
+ "eval_logits/chosen": -1.0127526828657614,
514
+ "eval_logits/rejected": -0.9702886589714581,
515
+ "eval_mean_token_accuracy": 0.7333163165301084,
516
+ "eval_rewards/chosen": 0.0008883264788382803,
517
+ "eval_rewards/rejected": 0.007837165784684316,
518
+ "eval_rewards/accuracies": 0.415,
519
+ "eval_rewards/margins": -0.00694883929831849,
520
+ "eval_logps/chosen": -50.164103578567506,
521
+ "eval_logps/rejected": -52.56150006484985,
522
+ "epoch": 0.2593226492401846,
523
+ "step": 250
524
+ },
525
+ {
526
+ "loss": 0.6938982009887695,
527
+ "grad_norm": 0.008658971637487411,
528
+ "learning_rate": 7.3160621761658035e-06,
529
+ "entropy": 0.8275363711640239,
530
+ "num_tokens": 17432770.0,
531
+ "logits/chosen": -0.9894071595486238,
532
+ "logits/rejected": -1.021770131425495,
533
+ "mean_token_accuracy": 0.7267817178182304,
534
+ "rewards/chosen": -6.325603737082019e-05,
535
+ "rewards/rejected": 0.0009481332914026552,
536
+ "rewards/accuracies": 0.5,
537
+ "rewards/margins": -0.0010113894138703472,
538
+ "logps/chosen": -53.769077570438384,
539
+ "logps/rejected": -54.760430970191955,
540
+ "epoch": 0.26969555520979205,
541
+ "step": 260
542
+ },
543
+ {
544
+ "loss": 0.6941106796264649,
545
+ "grad_norm": 0.009195917285978794,
546
+ "learning_rate": 7.212435233160623e-06,
547
+ "entropy": 0.8036660263128579,
548
+ "num_tokens": 18100438.0,
549
+ "logits/chosen": -1.0066855113664344,
550
+ "logits/rejected": -1.0124089541250572,
551
+ "mean_token_accuracy": 0.717040218450129,
552
+ "rewards/chosen": -0.003151719864085862,
553
+ "rewards/rejected": -0.00164005833167721,
554
+ "rewards/accuracies": 0.475,
555
+ "rewards/margins": -0.001511661496660963,
556
+ "logps/chosen": -49.700445964336396,
557
+ "logps/rejected": -50.435976998806,
558
+ "epoch": 0.28006846117939943,
559
+ "step": 270
560
+ },
561
+ {
562
+ "loss": 0.6933230876922607,
563
+ "grad_norm": 0.009418987669050694,
564
+ "learning_rate": 7.108808290155441e-06,
565
+ "entropy": 0.8158398796850815,
566
+ "num_tokens": 18772061.0,
567
+ "logits/chosen": -1.0278496914643969,
568
+ "logits/rejected": -1.0390610888345118,
569
+ "mean_token_accuracy": 0.724490509070456,
570
+ "rewards/chosen": -0.005928723971054524,
571
+ "rewards/rejected": -0.006031536482905722,
572
+ "rewards/accuracies": 0.52,
573
+ "rewards/margins": 0.0001028125207812991,
574
+ "logps/chosen": -53.07417652249336,
575
+ "logps/rejected": -52.73169189453125,
576
+ "epoch": 0.2904413671490068,
577
+ "step": 280
578
+ },
579
+ {
580
+ "loss": 0.6924946308135986,
581
+ "grad_norm": 0.008996859192848206,
582
+ "learning_rate": 7.005181347150259e-06,
583
+ "entropy": 0.801404341221787,
584
+ "num_tokens": 19443506.0,
585
+ "logits/chosen": -1.020471675081665,
586
+ "logits/rejected": -1.0060470756374977,
587
+ "mean_token_accuracy": 0.7225255416892469,
588
+ "rewards/chosen": -0.008651466769783837,
589
+ "rewards/rejected": -0.010357174093505818,
590
+ "rewards/accuracies": 0.5175,
591
+ "rewards/margins": 0.0017057072926036198,
592
+ "logps/chosen": -52.63102213382721,
593
+ "logps/rejected": -53.120495743751526,
594
+ "epoch": 0.3008142731186142,
595
+ "step": 290
596
+ },
597
+ {
598
+ "loss": 0.6929198741912842,
599
+ "grad_norm": 0.00904047954827547,
600
+ "learning_rate": 6.9015544041450784e-06,
601
+ "entropy": 0.7905970112606883,
602
+ "num_tokens": 20114567.0,
603
+ "logits/chosen": -1.0243293848557635,
604
+ "logits/rejected": -1.058803992605315,
605
+ "mean_token_accuracy": 0.7341359755769372,
606
+ "rewards/chosen": -0.012200816824647518,
607
+ "rewards/rejected": -0.01307745838902747,
608
+ "rewards/accuracies": 0.52125,
609
+ "rewards/margins": 0.000876641578397539,
610
+ "logps/chosen": -52.0853961968422,
611
+ "logps/rejected": -52.80914256095886,
612
+ "epoch": 0.3111871790882216,
613
+ "step": 300
614
+ },
615
+ {
616
+ "loss": 0.6928537845611572,
617
+ "grad_norm": 0.009816721081733704,
618
+ "learning_rate": 6.797927461139897e-06,
619
+ "entropy": 0.80872525641229,
620
+ "num_tokens": 20787766.0,
621
+ "logits/chosen": -0.9839863753234047,
622
+ "logits/rejected": -1.0009211278188388,
623
+ "mean_token_accuracy": 0.724884872585535,
624
+ "rewards/chosen": -0.012630892752328008,
625
+ "rewards/rejected": -0.01370205567994617,
626
+ "rewards/accuracies": 0.51125,
627
+ "rewards/margins": 0.0010711629761499353,
628
+ "logps/chosen": -54.78661850452423,
629
+ "logps/rejected": -53.24911024570465,
630
+ "epoch": 0.32156008505782896,
631
+ "step": 310
632
+ },
633
+ {
634
+ "loss": 0.6942753314971923,
635
+ "grad_norm": 0.009577946737408638,
636
+ "learning_rate": 6.6943005181347155e-06,
637
+ "entropy": 0.8015230012265966,
638
+ "num_tokens": 21457559.0,
639
+ "logits/chosen": -0.9992799805599515,
640
+ "logits/rejected": -1.0047482614113592,
641
+ "mean_token_accuracy": 0.7206378514692188,
642
+ "rewards/chosen": -0.015205535748583543,
643
+ "rewards/rejected": -0.013390423674327395,
644
+ "rewards/accuracies": 0.49625,
645
+ "rewards/margins": -0.0018151119937829209,
646
+ "logps/chosen": -52.25986159801483,
647
+ "logps/rejected": -53.13925377726555,
648
+ "epoch": 0.33193299102743634,
649
+ "step": 320
650
+ },
651
+ {
652
+ "loss": 0.6924636840820313,
653
+ "grad_norm": 0.009727108292281628,
654
+ "learning_rate": 6.590673575129535e-06,
655
+ "entropy": 0.8345451738173142,
656
+ "num_tokens": 22128277.0,
657
+ "logits/chosen": -0.971072161782628,
658
+ "logits/rejected": -0.9826513089025171,
659
+ "mean_token_accuracy": 0.7212898347340524,
660
+ "rewards/chosen": -0.016975908809049544,
661
+ "rewards/rejected": -0.018840813715414698,
662
+ "rewards/accuracies": 0.51625,
663
+ "rewards/margins": 0.001864904925096198,
664
+ "logps/chosen": -52.514592845439914,
665
+ "logps/rejected": -54.03662874937058,
666
+ "epoch": 0.3423058969970437,
667
+ "step": 330
668
+ },
669
+ {
670
+ "loss": 0.6921487808227539,
671
+ "grad_norm": 0.009848830290138721,
672
+ "learning_rate": 6.487046632124353e-06,
673
+ "entropy": 0.8036045160889626,
674
+ "num_tokens": 22798429.0,
675
+ "logits/chosen": -0.986366250980096,
676
+ "logits/rejected": -1.0395464497059017,
677
+ "mean_token_accuracy": 0.7169532440230251,
678
+ "rewards/chosen": -0.017634948804889063,
679
+ "rewards/rejected": -0.02014962821162044,
680
+ "rewards/accuracies": 0.54,
681
+ "rewards/margins": 0.002514679412379337,
682
+ "logps/chosen": -53.712123572826385,
683
+ "logps/rejected": -50.68536148548126,
684
+ "epoch": 0.3526788029666511,
685
+ "step": 340
686
+ },
687
+ {
688
+ "loss": 0.6948633670806885,
689
+ "grad_norm": 0.009547681547701359,
690
+ "learning_rate": 6.383419689119171e-06,
691
+ "entropy": 0.7954194891778752,
692
+ "num_tokens": 23470239.0,
693
+ "logits/chosen": -1.0014035524600693,
694
+ "logits/rejected": -0.9692854696785687,
695
+ "mean_token_accuracy": 0.7198419809341431,
696
+ "rewards/chosen": -0.019529370157788436,
697
+ "rewards/rejected": -0.016619607036818706,
698
+ "rewards/accuracies": 0.5,
699
+ "rewards/margins": -0.002909763151255902,
700
+ "logps/chosen": -54.53537731409073,
701
+ "logps/rejected": -52.964653131961825,
702
+ "epoch": 0.3630517089362585,
703
+ "step": 350
704
+ },
705
+ {
706
+ "loss": 0.6930148601531982,
707
+ "grad_norm": 0.00898800976574421,
708
+ "learning_rate": 6.2797927461139905e-06,
709
+ "entropy": 0.7794413399184122,
710
+ "num_tokens": 24140239.0,
711
+ "logits/chosen": -1.0375333631207078,
712
+ "logits/rejected": -1.0100693145671888,
713
+ "mean_token_accuracy": 0.737273293249309,
714
+ "rewards/chosen": -0.016578698544473695,
715
+ "rewards/rejected": -0.017291930461324226,
716
+ "rewards/accuracies": 0.4975,
717
+ "rewards/margins": 0.000713231952759088,
718
+ "logps/chosen": -49.863780752420425,
719
+ "logps/rejected": -52.97674039840698,
720
+ "epoch": 0.37342461490586587,
721
+ "step": 360
722
+ },
723
+ {
724
+ "loss": 0.6929784297943116,
725
+ "grad_norm": 0.008984371088445187,
726
+ "learning_rate": 6.176165803108809e-06,
727
+ "entropy": 0.8129843348357827,
728
+ "num_tokens": 24812178.0,
729
+ "logits/chosen": -0.9893493454110454,
730
+ "logits/rejected": -0.9891808390055474,
731
+ "mean_token_accuracy": 0.727164792958647,
732
+ "rewards/chosen": -0.018017661249964477,
733
+ "rewards/rejected": -0.01882471950921399,
734
+ "rewards/accuracies": 0.4975,
735
+ "rewards/margins": 0.0008070582516302239,
736
+ "logps/chosen": -53.014821940660475,
737
+ "logps/rejected": -54.58460282325745,
738
+ "epoch": 0.38379752087547325,
739
+ "step": 370
740
+ },
741
+ {
742
+ "eval_loss": 0.6905523538589478,
743
+ "eval_runtime": 245.3265,
744
+ "eval_samples_per_second": 4.076,
745
+ "eval_steps_per_second": 4.076,
746
+ "eval_entropy": 0.7969645112715662,
747
+ "eval_num_tokens": 25147105.0,
748
+ "eval_logits/chosen": -1.0253711017755525,
749
+ "eval_logits/rejected": -0.9797990125942502,
750
+ "eval_mean_token_accuracy": 0.7333250712603331,
751
+ "eval_rewards/chosen": -0.015263017903128458,
752
+ "eval_rewards/rejected": -0.020903651809865552,
753
+ "eval_rewards/accuracies": 0.55,
754
+ "eval_rewards/margins": 0.005640633857896319,
755
+ "eval_logps/chosen": -50.32561701965332,
756
+ "eval_logps/rejected": -52.84890823554993,
757
+ "epoch": 0.38898397386027694,
758
+ "step": 375
759
+ },
760
+ {
761
+ "loss": 0.6925588607788086,
762
+ "grad_norm": 0.009255084209144115,
763
+ "learning_rate": 6.0725388601036275e-06,
764
+ "entropy": 0.7894979556603358,
765
+ "num_tokens": 25482532.0,
766
+ "logits/chosen": -1.0074889789440618,
767
+ "logits/rejected": -0.9709891010763303,
768
+ "mean_token_accuracy": 0.7268249686434864,
769
+ "rewards/chosen": -0.017496899721906517,
770
+ "rewards/rejected": -0.019117686107287854,
771
+ "rewards/accuracies": 0.52625,
772
+ "rewards/margins": 0.001620786436178605,
773
+ "logps/chosen": -51.8191835963726,
774
+ "logps/rejected": -51.592100315093994,
775
+ "epoch": 0.39417042684508063,
776
+ "step": 380
777
+ },
778
+ {
779
+ "loss": 0.6923740386962891,
780
+ "grad_norm": 0.009324838407337666,
781
+ "learning_rate": 5.968911917098445e-06,
782
+ "entropy": 0.8094338296726346,
783
+ "num_tokens": 26154266.0,
784
+ "logits/chosen": -0.9966710708958524,
785
+ "logits/rejected": -0.9879505808785741,
786
+ "mean_token_accuracy": 0.7231129581481218,
787
+ "rewards/chosen": -0.017760099685847307,
788
+ "rewards/rejected": -0.019829784269199992,
789
+ "rewards/accuracies": 0.51875,
790
+ "rewards/margins": 0.0020696846699866,
791
+ "logps/chosen": -53.66926085233688,
792
+ "logps/rejected": -54.18102238893509,
793
+ "epoch": 0.404543332814688,
794
+ "step": 390
795
+ },
796
+ {
797
+ "loss": 0.6929931163787841,
798
+ "grad_norm": 0.010886781848967075,
799
+ "learning_rate": 5.865284974093265e-06,
800
+ "entropy": 0.8130081182997674,
801
+ "num_tokens": 26825159.0,
802
+ "logits/chosen": -1.026189590043526,
803
+ "logits/rejected": -0.980070075731585,
804
+ "mean_token_accuracy": 0.7226042114198208,
805
+ "rewards/chosen": -0.019220582297640475,
806
+ "rewards/rejected": -0.020057831880958474,
807
+ "rewards/accuracies": 0.48125,
808
+ "rewards/margins": 0.0008372495489311404,
809
+ "logps/chosen": -52.43204548358917,
810
+ "logps/rejected": -54.36065078496933,
811
+ "epoch": 0.4149162387842954,
812
+ "step": 400
813
+ },
814
+ {
815
+ "loss": 0.693073320388794,
816
+ "grad_norm": 0.009156073443591595,
817
+ "learning_rate": 5.761658031088083e-06,
818
+ "entropy": 0.7959862072952092,
819
+ "num_tokens": 27495663.0,
820
+ "logits/chosen": -1.0194205629554802,
821
+ "logits/rejected": -1.008366009739435,
822
+ "mean_token_accuracy": 0.7243296534568071,
823
+ "rewards/chosen": -0.01809768541224912,
824
+ "rewards/rejected": -0.01875489959079914,
825
+ "rewards/accuracies": 0.5025,
826
+ "rewards/margins": 0.0006572141727883718,
827
+ "logps/chosen": -52.169967291355135,
828
+ "logps/rejected": -53.42250164747238,
829
+ "epoch": 0.4252891447539028,
830
+ "step": 410
831
+ },
832
+ {
833
+ "loss": 0.6924574375152588,
834
+ "grad_norm": 0.010202614590525627,
835
+ "learning_rate": 5.658031088082902e-06,
836
+ "entropy": 0.7918436706252396,
837
+ "num_tokens": 28167389.0,
838
+ "logits/chosen": -1.0232014742112978,
839
+ "logits/rejected": -1.0440852867532966,
840
+ "mean_token_accuracy": 0.7258787673525512,
841
+ "rewards/chosen": -0.015947307585583416,
842
+ "rewards/rejected": -0.017838909620567733,
843
+ "rewards/accuracies": 0.5075,
844
+ "rewards/margins": 0.0018916020590404514,
845
+ "logps/chosen": -54.433519496917725,
846
+ "logps/rejected": -53.2144430232048,
847
+ "epoch": 0.4356620507235102,
848
+ "step": 420
849
+ },
850
+ {
851
+ "loss": 0.6926542282104492,
852
+ "grad_norm": 0.01011913362890482,
853
+ "learning_rate": 5.554404145077721e-06,
854
+ "entropy": 0.8117843008134514,
855
+ "num_tokens": 28839388.0,
856
+ "logits/chosen": -0.9718024988912555,
857
+ "logits/rejected": -0.9786808761441761,
858
+ "mean_token_accuracy": 0.7248365879803896,
859
+ "rewards/chosen": -0.014674390776453947,
860
+ "rewards/rejected": -0.016148133582082665,
861
+ "rewards/accuracies": 0.52875,
862
+ "rewards/margins": 0.001473742745729396,
863
+ "logps/chosen": -51.187984328269955,
864
+ "logps/rejected": -54.15149886369705,
865
+ "epoch": 0.4460349566931176,
866
+ "step": 430
867
+ },
868
+ {
869
+ "loss": 0.6937287330627442,
870
+ "grad_norm": 0.008680191822350025,
871
+ "learning_rate": 5.4507772020725395e-06,
872
+ "entropy": 0.7826772296521812,
873
+ "num_tokens": 29510096.0,
874
+ "logits/chosen": -1.038226736136573,
875
+ "logits/rejected": -1.0398130834010744,
876
+ "mean_token_accuracy": 0.7318821278214455,
877
+ "rewards/chosen": -0.01869894893682158,
878
+ "rewards/rejected": -0.01806240452982365,
879
+ "rewards/accuracies": 0.47625,
880
+ "rewards/margins": -0.0006365444045513868,
881
+ "logps/chosen": -51.81987749576569,
882
+ "logps/rejected": -51.031341784000396,
883
+ "epoch": 0.456407862662725,
884
+ "step": 440
885
+ },
886
+ {
887
+ "loss": 0.6937658309936523,
888
+ "grad_norm": 0.009057857096195221,
889
+ "learning_rate": 5.347150259067357e-06,
890
+ "entropy": 0.7959510098583996,
891
+ "num_tokens": 30181792.0,
892
+ "logits/chosen": -1.0239556820922306,
893
+ "logits/rejected": -1.0394439887711346,
894
+ "mean_token_accuracy": 0.7198793402686715,
895
+ "rewards/chosen": -0.01936899814491426,
896
+ "rewards/rejected": -0.01868944700636348,
897
+ "rewards/accuracies": 0.50375,
898
+ "rewards/margins": -0.0006795510534720961,
899
+ "logps/chosen": -54.870300602912906,
900
+ "logps/rejected": -50.76141629695892,
901
+ "epoch": 0.46678076863233237,
902
+ "step": 450
903
+ },
904
+ {
905
+ "loss": 0.694075345993042,
906
+ "grad_norm": 0.009986916556954384,
907
+ "learning_rate": 5.243523316062177e-06,
908
+ "entropy": 0.7800668972823769,
909
+ "num_tokens": 30851409.0,
910
+ "logits/chosen": -1.0086595854613267,
911
+ "logits/rejected": -1.0357231874675175,
912
+ "mean_token_accuracy": 0.7262966002896428,
913
+ "rewards/chosen": -0.020605784776303152,
914
+ "rewards/rejected": -0.019295487125091312,
915
+ "rewards/accuracies": 0.48125,
916
+ "rewards/margins": -0.0013102977239759638,
917
+ "logps/chosen": -53.48096129179001,
918
+ "logps/rejected": -51.299415925741194,
919
+ "epoch": 0.47715367460193975,
920
+ "step": 460
921
+ },
922
+ {
923
+ "loss": 0.6933310985565185,
924
+ "grad_norm": 0.007825742475688457,
925
+ "learning_rate": 5.139896373056995e-06,
926
+ "entropy": 0.7754787660343573,
927
+ "num_tokens": 31519564.0,
928
+ "logits/chosen": -1.0726965671758735,
929
+ "logits/rejected": -1.003480362234256,
930
+ "mean_token_accuracy": 0.7201942896470428,
931
+ "rewards/chosen": -0.017236333386230172,
932
+ "rewards/rejected": -0.017384318440863352,
933
+ "rewards/accuracies": 0.4825,
934
+ "rewards/margins": 0.00014798504006648726,
935
+ "logps/chosen": -49.58583438396454,
936
+ "logps/rejected": -51.69670748949051,
937
+ "epoch": 0.48752658057154713,
938
+ "step": 470
939
+ },
940
+ {
941
+ "loss": 0.6922287940979004,
942
+ "grad_norm": 0.008367015048861504,
943
+ "learning_rate": 5.036269430051814e-06,
944
+ "entropy": 0.8279160013142973,
945
+ "num_tokens": 32192056.0,
946
+ "logits/chosen": -0.9712868713229077,
947
+ "logits/rejected": -0.9765040762093227,
948
+ "mean_token_accuracy": 0.7188576187193394,
949
+ "rewards/chosen": -0.01717338605103805,
950
+ "rewards/rejected": -0.019571030664633327,
951
+ "rewards/accuracies": 0.51125,
952
+ "rewards/margins": 0.0023976446047163334,
953
+ "logps/chosen": -54.479641914367676,
954
+ "logps/rejected": -54.63456130981445,
955
+ "epoch": 0.4978994865411545,
956
+ "step": 480
957
+ },
958
+ {
959
+ "loss": 0.6939034461975098,
960
+ "grad_norm": 0.008626270107924938,
961
+ "learning_rate": 4.932642487046633e-06,
962
+ "entropy": 0.8010151171591133,
963
+ "num_tokens": 32864077.0,
964
+ "logits/chosen": -1.0169706789174378,
965
+ "logits/rejected": -1.0165859789377836,
966
+ "mean_token_accuracy": 0.7208031569048763,
967
+ "rewards/chosen": -0.01987447723532,
968
+ "rewards/rejected": -0.018864784324341598,
969
+ "rewards/accuracies": 0.495,
970
+ "rewards/margins": -0.0010096929259452735,
971
+ "logps/chosen": -53.33563009738922,
972
+ "logps/rejected": -53.87229782342911,
973
+ "epoch": 0.5082723925107618,
974
+ "step": 490
975
+ },
976
+ {
977
+ "loss": 0.6938543319702148,
978
+ "grad_norm": 0.010269825346767902,
979
+ "learning_rate": 4.829015544041451e-06,
980
+ "entropy": 0.7891198094375431,
981
+ "num_tokens": 33534279.0,
982
+ "logits/chosen": -1.033360492470276,
983
+ "logits/rejected": -1.0354731196495317,
984
+ "mean_token_accuracy": 0.7333813977241516,
985
+ "rewards/chosen": -0.019480555365971666,
986
+ "rewards/rejected": -0.01867740810344003,
987
+ "rewards/accuracies": 0.51,
988
+ "rewards/margins": -0.0008031472803850193,
989
+ "logps/chosen": -52.630670845508575,
990
+ "logps/rejected": -50.910942976474765,
991
+ "epoch": 0.5186452984803692,
992
+ "step": 500
993
+ },
994
+ {
995
+ "eval_loss": 0.6942050457000732,
996
+ "eval_runtime": 276.9162,
997
+ "eval_samples_per_second": 3.611,
998
+ "eval_steps_per_second": 3.611,
999
+ "eval_entropy": 0.7935083331502975,
1000
+ "eval_num_tokens": 33534279.0,
1001
+ "eval_logits/chosen": -1.0600360631491812,
1002
+ "eval_logits/rejected": -1.0166348149416253,
1003
+ "eval_mean_token_accuracy": 0.7330459494143724,
1004
+ "eval_rewards/chosen": -0.021802856784763208,
1005
+ "eval_rewards/rejected": -0.02036227696077913,
1006
+ "eval_rewards/accuracies": 0.477,
1007
+ "eval_rewards/margins": -0.0014405797821236774,
1008
+ "eval_logps/chosen": -50.39101540756226,
1009
+ "eval_logps/rejected": -52.84349448776245,
1010
+ "epoch": 0.5186452984803692,
1011
+ "step": 500
1012
+ },
1013
+ {
1014
+ "loss": 0.6938997745513916,
1015
+ "grad_norm": 0.00896107591688633,
1016
+ "learning_rate": 4.72538860103627e-06,
1017
+ "entropy": 0.7882147227507085,
1018
+ "num_tokens": 34205135.0,
1019
+ "logits/chosen": -1.0076570653558603,
1020
+ "logits/rejected": -1.0416575961228518,
1021
+ "mean_token_accuracy": 0.7137932823970914,
1022
+ "rewards/chosen": -0.018858550680542974,
1023
+ "rewards/rejected": -0.017997891291797713,
1024
+ "rewards/accuracies": 0.495,
1025
+ "rewards/margins": -0.0008606594161392423,
1026
+ "logps/chosen": -54.12554481744766,
1027
+ "logps/rejected": -50.22665623903274,
1028
+ "epoch": 0.5290182044499767,
1029
+ "step": 510
1030
+ },
1031
+ {
1032
+ "loss": 0.6940505504608154,
1033
+ "grad_norm": 0.009844881482422352,
1034
+ "learning_rate": 4.621761658031089e-06,
1035
+ "entropy": 0.7678585767536424,
1036
+ "num_tokens": 34873976.0,
1037
+ "logits/chosen": -1.0794209366681549,
1038
+ "logits/rejected": -1.0414292466399215,
1039
+ "mean_token_accuracy": 0.7310516293905676,
1040
+ "rewards/chosen": -0.013213514556548489,
1041
+ "rewards/rejected": -0.011983713133254241,
1042
+ "rewards/accuracies": 0.515,
1043
+ "rewards/margins": -0.0012298014553380199,
1044
+ "logps/chosen": -51.02845492362976,
1045
+ "logps/rejected": -49.72117327451706,
1046
+ "epoch": 0.5393911104195841,
1047
+ "step": 520
1048
+ },
1049
+ {
1050
+ "loss": 0.6937035083770752,
1051
+ "grad_norm": 0.009832088835537434,
1052
+ "learning_rate": 4.518134715025907e-06,
1053
+ "entropy": 0.8068192195380106,
1054
+ "num_tokens": 35544999.0,
1055
+ "logits/chosen": -1.0203095909710327,
1056
+ "logits/rejected": -1.0544799987360511,
1057
+ "mean_token_accuracy": 0.7208610328473151,
1058
+ "rewards/chosen": -0.013758049447855001,
1059
+ "rewards/rejected": -0.013221281499590986,
1060
+ "rewards/accuracies": 0.50375,
1061
+ "rewards/margins": -0.0005367679687333293,
1062
+ "logps/chosen": -53.891741864681244,
1063
+ "logps/rejected": -52.176739025115964,
1064
+ "epoch": 0.5497640163891915,
1065
+ "step": 530
1066
+ },
1067
+ {
1068
+ "loss": 0.693358039855957,
1069
+ "grad_norm": 0.009179627522826195,
1070
+ "learning_rate": 4.414507772020726e-06,
1071
+ "entropy": 0.8059323144424707,
1072
+ "num_tokens": 36215629.0,
1073
+ "logits/chosen": -1.0271287046641675,
1074
+ "logits/rejected": -1.0058586337462303,
1075
+ "mean_token_accuracy": 0.7286789271980524,
1076
+ "rewards/chosen": -0.01192244978853978,
1077
+ "rewards/rejected": -0.011959875774573447,
1078
+ "rewards/accuracies": 0.495,
1079
+ "rewards/margins": 3.742602792044636e-05,
1080
+ "logps/chosen": -50.73393731594086,
1081
+ "logps/rejected": -52.839989113807675,
1082
+ "epoch": 0.5601369223587989,
1083
+ "step": 540
1084
+ },
1085
+ {
1086
+ "loss": 0.693217134475708,
1087
+ "grad_norm": 0.008687409572303295,
1088
+ "learning_rate": 4.310880829015544e-06,
1089
+ "entropy": 0.8455263479612768,
1090
+ "num_tokens": 36888235.0,
1091
+ "logits/chosen": -0.9577911917232584,
1092
+ "logits/rejected": -0.9647921425538288,
1093
+ "mean_token_accuracy": 0.7241826535388828,
1094
+ "rewards/chosen": -0.012230233296829738,
1095
+ "rewards/rejected": -0.012580791678369679,
1096
+ "rewards/accuracies": 0.52,
1097
+ "rewards/margins": 0.00035055841028224676,
1098
+ "logps/chosen": -53.09883669376373,
1099
+ "logps/rejected": -56.72353342294693,
1100
+ "epoch": 0.5705098283284062,
1101
+ "step": 550
1102
+ },
1103
+ {
1104
+ "loss": 0.6929863929748535,
1105
+ "grad_norm": 0.008931291289627552,
1106
+ "learning_rate": 4.207253886010363e-06,
1107
+ "entropy": 0.8086647934932262,
1108
+ "num_tokens": 37560215.0,
1109
+ "logits/chosen": -1.0313529810131257,
1110
+ "logits/rejected": -1.0182036791475924,
1111
+ "mean_token_accuracy": 0.7183289608359337,
1112
+ "rewards/chosen": -0.013141918864030232,
1113
+ "rewards/rejected": -0.013932020409274628,
1114
+ "rewards/accuracies": 0.505,
1115
+ "rewards/margins": 0.0007901015544848633,
1116
+ "logps/chosen": -52.67770826101303,
1117
+ "logps/rejected": -52.252629327774045,
1118
+ "epoch": 0.5808827342980136,
1119
+ "step": 560
1120
+ },
1121
+ {
1122
+ "loss": 0.6919141292572022,
1123
+ "grad_norm": 0.00928713008761406,
1124
+ "learning_rate": 4.103626943005182e-06,
1125
+ "entropy": 0.795804328629747,
1126
+ "num_tokens": 38229872.0,
1127
+ "logits/chosen": -1.0115969525038464,
1128
+ "logits/rejected": -0.9389554266112111,
1129
+ "mean_token_accuracy": 0.7316008464246988,
1130
+ "rewards/chosen": -0.011151957947622576,
1131
+ "rewards/rejected": -0.014132183314768555,
1132
+ "rewards/accuracies": 0.54375,
1133
+ "rewards/margins": 0.0029802253525849664,
1134
+ "logps/chosen": -50.29158478021622,
1135
+ "logps/rejected": -53.326151065826416,
1136
+ "epoch": 0.591255640267621,
1137
+ "step": 570
1138
+ },
1139
+ {
1140
+ "loss": 0.6936386585235595,
1141
+ "grad_norm": 0.009219864383339882,
1142
+ "learning_rate": 4.000000000000001e-06,
1143
+ "entropy": 0.7849282765295357,
1144
+ "num_tokens": 38898599.0,
1145
+ "logits/chosen": -1.0318535424181245,
1146
+ "logits/rejected": -1.0693508828519998,
1147
+ "mean_token_accuracy": 0.7279249535314739,
1148
+ "rewards/chosen": -0.015236615104731755,
1149
+ "rewards/rejected": -0.01477163603422241,
1150
+ "rewards/accuracies": 0.49375,
1151
+ "rewards/margins": -0.00046497906170770873,
1152
+ "logps/chosen": -50.606445105075835,
1153
+ "logps/rejected": -50.23892628192902,
1154
+ "epoch": 0.6016285462372284,
1155
+ "step": 580
1156
+ },
1157
+ {
1158
+ "loss": 0.6924667358398438,
1159
+ "grad_norm": 0.009871033020317554,
1160
+ "learning_rate": 3.896373056994819e-06,
1161
+ "entropy": 0.7915234410995617,
1162
+ "num_tokens": 39570011.0,
1163
+ "logits/chosen": -1.0704431655924542,
1164
+ "logits/rejected": -1.0262311271415063,
1165
+ "mean_token_accuracy": 0.7341923769563437,
1166
+ "rewards/chosen": -0.013985364213192497,
1167
+ "rewards/rejected": -0.015847310858209767,
1168
+ "rewards/accuracies": 0.53625,
1169
+ "rewards/margins": 0.0018619466816016939,
1170
+ "logps/chosen": -53.37289155721665,
1171
+ "logps/rejected": -53.37732348442078,
1172
+ "epoch": 0.6120014522068358,
1173
+ "step": 590
1174
+ },
1175
+ {
1176
+ "loss": 0.6934967041015625,
1177
+ "grad_norm": 0.008916029706597328,
1178
+ "learning_rate": 3.7927461139896377e-06,
1179
+ "entropy": 0.7781280868733301,
1180
+ "num_tokens": 40238459.0,
1181
+ "logits/chosen": -1.031845585303488,
1182
+ "logits/rejected": -1.0679663812358249,
1183
+ "mean_token_accuracy": 0.7267250791564583,
1184
+ "rewards/chosen": -0.015354626149126034,
1185
+ "rewards/rejected": -0.015155612989574366,
1186
+ "rewards/accuracies": 0.495,
1187
+ "rewards/margins": -0.0001990132535865996,
1188
+ "logps/chosen": -50.91896806716919,
1189
+ "logps/rejected": -49.1647160077095,
1190
+ "epoch": 0.6223743581764432,
1191
+ "step": 600
1192
+ },
1193
+ {
1194
+ "loss": 0.6943734169006348,
1195
+ "grad_norm": 0.009726111777126789,
1196
+ "learning_rate": 3.6891191709844567e-06,
1197
+ "entropy": 0.8024784850515425,
1198
+ "num_tokens": 40907823.0,
1199
+ "logits/chosen": -1.0033099905488874,
1200
+ "logits/rejected": -1.004673033873931,
1201
+ "mean_token_accuracy": 0.7266425576806068,
1202
+ "rewards/chosen": -0.016839503781302483,
1203
+ "rewards/rejected": -0.014924811632938316,
1204
+ "rewards/accuracies": 0.485,
1205
+ "rewards/margins": -0.0019146921102219494,
1206
+ "logps/chosen": -51.37045606851578,
1207
+ "logps/rejected": -50.59996291279793,
1208
+ "epoch": 0.6327472641460505,
1209
+ "step": 610
1210
+ },
1211
+ {
1212
+ "loss": 0.693054485321045,
1213
+ "grad_norm": 0.00853179581463337,
1214
+ "learning_rate": 3.5854922279792748e-06,
1215
+ "entropy": 0.7575920634204522,
1216
+ "num_tokens": 41576629.0,
1217
+ "logits/chosen": -1.0128204565402743,
1218
+ "logits/rejected": -1.0291723665089934,
1219
+ "mean_token_accuracy": 0.7279130771569907,
1220
+ "rewards/chosen": -0.014212547984803337,
1221
+ "rewards/rejected": -0.014947609209768871,
1222
+ "rewards/accuracies": 0.48875,
1223
+ "rewards/margins": 0.000735061179366312,
1224
+ "logps/chosen": -50.57350071668625,
1225
+ "logps/rejected": -49.389897744655606,
1226
+ "epoch": 0.6431201701156579,
1227
+ "step": 620
1228
+ },
1229
+ {
1230
+ "eval_loss": 0.6942050457000732,
1231
+ "eval_runtime": 307.8984,
1232
+ "eval_samples_per_second": 3.248,
1233
+ "eval_steps_per_second": 3.248,
1234
+ "eval_entropy": 0.7959122954644263,
1235
+ "eval_num_tokens": 41911681.0,
1236
+ "eval_logits/chosen": -1.048361439070786,
1237
+ "eval_logits/rejected": -1.0055296550561397,
1238
+ "eval_mean_token_accuracy": 0.7335138544887304,
1239
+ "eval_rewards/chosen": -0.014208579457705128,
1240
+ "eval_rewards/rejected": -0.01261782132985536,
1241
+ "eval_rewards/accuracies": 0.478,
1242
+ "eval_rewards/margins": -0.0015907581194769592,
1243
+ "eval_logps/chosen": -50.31507263565064,
1244
+ "eval_logps/rejected": -52.76604993247986,
1245
+ "epoch": 0.6483066231004616,
1246
+ "step": 625
1247
+ },
1248
+ {
1249
+ "loss": 0.6939579486846924,
1250
+ "grad_norm": 0.009789089672267437,
1251
+ "learning_rate": 3.4818652849740937e-06,
1252
+ "entropy": 0.7933417669357732,
1253
+ "num_tokens": 42247859.0,
1254
+ "logits/chosen": -1.0118922806884323,
1255
+ "logits/rejected": -1.0382741999872491,
1256
+ "mean_token_accuracy": 0.726150699108839,
1257
+ "rewards/chosen": -0.014976464999999734,
1258
+ "rewards/rejected": -0.013932963377121722,
1259
+ "rewards/accuracies": 0.47375,
1260
+ "rewards/margins": -0.0010435017172130757,
1261
+ "logps/chosen": -53.83100793600082,
1262
+ "logps/rejected": -50.46369902849197,
1263
+ "epoch": 0.6534930760852653,
1264
+ "step": 630
1265
+ },
1266
+ {
1267
+ "loss": 0.694810152053833,
1268
+ "grad_norm": 0.009261916391551495,
1269
+ "learning_rate": 3.3782383419689123e-06,
1270
+ "entropy": 0.7883505333820358,
1271
+ "num_tokens": 42918160.0,
1272
+ "logits/chosen": -1.017383539174631,
1273
+ "logits/rejected": -1.054998851475991,
1274
+ "mean_token_accuracy": 0.7168397939577699,
1275
+ "rewards/chosen": -0.015089196973789569,
1276
+ "rewards/rejected": -0.012242867652641962,
1277
+ "rewards/accuracies": 0.46,
1278
+ "rewards/margins": -0.0028463293392269407,
1279
+ "logps/chosen": -54.35950309753418,
1280
+ "logps/rejected": -48.9059769487381,
1281
+ "epoch": 0.6638659820548727,
1282
+ "step": 640
1283
+ },
1284
+ {
1285
+ "loss": 0.6925888061523438,
1286
+ "grad_norm": 0.00910037662833929,
1287
+ "learning_rate": 3.274611398963731e-06,
1288
+ "entropy": 0.790731361717917,
1289
+ "num_tokens": 43587843.0,
1290
+ "logits/chosen": -0.9965395541483734,
1291
+ "logits/rejected": -1.0179589161213116,
1292
+ "mean_token_accuracy": 0.7306452417373657,
1293
+ "rewards/chosen": -0.010891549229872908,
1294
+ "rewards/rejected": -0.012513885581938666,
1295
+ "rewards/accuracies": 0.52875,
1296
+ "rewards/margins": 0.0016223363954850356,
1297
+ "logps/chosen": -51.07387138366699,
1298
+ "logps/rejected": -51.394845466613766,
1299
+ "epoch": 0.6742388880244801,
1300
+ "step": 650
1301
+ },
1302
+ {
1303
+ "loss": 0.693898057937622,
1304
+ "grad_norm": 0.009298712946474552,
1305
+ "learning_rate": 3.1709844559585493e-06,
1306
+ "entropy": 0.7892762251244858,
1307
+ "num_tokens": 44256661.0,
1308
+ "logits/chosen": -1.040483162193093,
1309
+ "logits/rejected": -1.0218257141848732,
1310
+ "mean_token_accuracy": 0.7231168592534959,
1311
+ "rewards/chosen": -0.012846070201399017,
1312
+ "rewards/rejected": -0.01177774412741428,
1313
+ "rewards/accuracies": 0.495,
1314
+ "rewards/margins": -0.001068326040294778,
1315
+ "logps/chosen": -50.02721215367317,
1316
+ "logps/rejected": -51.92197064161301,
1317
+ "epoch": 0.6846117939940874,
1318
+ "step": 660
1319
+ },
1320
+ {
1321
+ "loss": 0.6929262161254883,
1322
+ "grad_norm": 0.009983985684812069,
1323
+ "learning_rate": 3.0673575129533683e-06,
1324
+ "entropy": 0.7727112902654335,
1325
+ "num_tokens": 44928208.0,
1326
+ "logits/chosen": -1.033872497474533,
1327
+ "logits/rejected": -1.0355189189593426,
1328
+ "mean_token_accuracy": 0.7299729858152568,
1329
+ "rewards/chosen": -0.012007646745373676,
1330
+ "rewards/rejected": -0.012911729082511557,
1331
+ "rewards/accuracies": 0.49625,
1332
+ "rewards/margins": 0.0009040823050418112,
1333
+ "logps/chosen": -52.13899112701416,
1334
+ "logps/rejected": -50.62764532446861,
1335
+ "epoch": 0.6949846999636948,
1336
+ "step": 670
1337
+ },
1338
+ {
1339
+ "loss": 0.6946879863739014,
1340
+ "grad_norm": 0.009130201302468777,
1341
+ "learning_rate": 2.963730569948187e-06,
1342
+ "entropy": 0.8138119697524234,
1343
+ "num_tokens": 45599959.0,
1344
+ "logits/chosen": -0.966092846678868,
1345
+ "logits/rejected": -0.9774829642341187,
1346
+ "mean_token_accuracy": 0.7230793483182788,
1347
+ "rewards/chosen": -0.015864108831710837,
1348
+ "rewards/rejected": -0.013314598076967742,
1349
+ "rewards/accuracies": 0.4675,
1350
+ "rewards/margins": -0.0025495107232927695,
1351
+ "logps/chosen": -54.92970582008362,
1352
+ "logps/rejected": -52.76770358800888,
1353
+ "epoch": 0.7053576059333022,
1354
+ "step": 680
1355
+ },
1356
+ {
1357
+ "loss": 0.6929837703704834,
1358
+ "grad_norm": 0.009250026196241379,
1359
+ "learning_rate": 2.8601036269430053e-06,
1360
+ "entropy": 0.82899127332028,
1361
+ "num_tokens": 46271100.0,
1362
+ "logits/chosen": -0.9898684929018607,
1363
+ "logits/rejected": -0.9973996765394122,
1364
+ "mean_token_accuracy": 0.719442187603563,
1365
+ "rewards/chosen": -0.010820029947699367,
1366
+ "rewards/rejected": -0.01162173981451815,
1367
+ "rewards/accuracies": 0.515,
1368
+ "rewards/margins": 0.0008017099273274653,
1369
+ "logps/chosen": -51.98621440887451,
1370
+ "logps/rejected": -54.959817726612094,
1371
+ "epoch": 0.7157305119029096,
1372
+ "step": 690
1373
+ },
1374
+ {
1375
+ "loss": 0.6941079139709473,
1376
+ "grad_norm": 0.009462058544158936,
1377
+ "learning_rate": 2.7564766839378243e-06,
1378
+ "entropy": 0.7970602755853906,
1379
+ "num_tokens": 46940588.0,
1380
+ "logits/chosen": -0.990150519364322,
1381
+ "logits/rejected": -0.9981860405217275,
1382
+ "mean_token_accuracy": 0.7297776956856251,
1383
+ "rewards/chosen": -0.012557482681352213,
1384
+ "rewards/rejected": -0.011030125059482998,
1385
+ "rewards/accuracies": 0.51,
1386
+ "rewards/margins": -0.0015273576516483445,
1387
+ "logps/chosen": -49.37967163324356,
1388
+ "logps/rejected": -53.13790496587753,
1389
+ "epoch": 0.726103417872517,
1390
+ "step": 700
1391
+ },
1392
+ {
1393
+ "loss": 0.6923154830932617,
1394
+ "grad_norm": 0.008459668606519699,
1395
+ "learning_rate": 2.6528497409326424e-06,
1396
+ "entropy": 0.7973380678170361,
1397
+ "num_tokens": 47612649.0,
1398
+ "logits/chosen": -1.0290440507413436,
1399
+ "logits/rejected": -1.0325854925972269,
1400
+ "mean_token_accuracy": 0.7238865295890718,
1401
+ "rewards/chosen": -0.012139474128680376,
1402
+ "rewards/rejected": -0.014260805117913602,
1403
+ "rewards/accuracies": 0.52875,
1404
+ "rewards/margins": 0.0021213308708684054,
1405
+ "logps/chosen": -52.259123842716214,
1406
+ "logps/rejected": -54.400773532390595,
1407
+ "epoch": 0.7364763238421244,
1408
+ "step": 710
1409
+ },
1410
+ {
1411
+ "loss": 0.6927196025848389,
1412
+ "grad_norm": 0.008741075173020363,
1413
+ "learning_rate": 2.5492227979274614e-06,
1414
+ "entropy": 0.776990000186488,
1415
+ "num_tokens": 48280316.0,
1416
+ "logits/chosen": -1.02981366786685,
1417
+ "logits/rejected": -1.062369960988718,
1418
+ "mean_token_accuracy": 0.728738241456449,
1419
+ "rewards/chosen": -0.0141699135041722,
1420
+ "rewards/rejected": -0.01543546461060032,
1421
+ "rewards/accuracies": 0.52,
1422
+ "rewards/margins": 0.0012655511016782838,
1423
+ "logps/chosen": -50.75450169801712,
1424
+ "logps/rejected": -50.51603441476822,
1425
+ "epoch": 0.7468492298117317,
1426
+ "step": 720
1427
+ },
1428
+ {
1429
+ "loss": 0.6939631938934326,
1430
+ "grad_norm": 0.008915440179407597,
1431
+ "learning_rate": 2.44559585492228e-06,
1432
+ "entropy": 0.8170583094470203,
1433
+ "num_tokens": 48952457.0,
1434
+ "logits/chosen": -1.003780851996667,
1435
+ "logits/rejected": -0.9864155673137232,
1436
+ "mean_token_accuracy": 0.7165420038998127,
1437
+ "rewards/chosen": -0.013467036513036419,
1438
+ "rewards/rejected": -0.012332614251897666,
1439
+ "rewards/accuracies": 0.495,
1440
+ "rewards/margins": -0.0011344222621119116,
1441
+ "logps/chosen": -54.76776822566986,
1442
+ "logps/rejected": -52.639701968431474,
1443
+ "epoch": 0.7572221357813391,
1444
+ "step": 730
1445
+ },
1446
+ {
1447
+ "loss": 0.6925458908081055,
1448
+ "grad_norm": 0.01004419568926096,
1449
+ "learning_rate": 2.3419689119170984e-06,
1450
+ "entropy": 0.8180013949144631,
1451
+ "num_tokens": 49623039.0,
1452
+ "logits/chosen": -1.0169417811830719,
1453
+ "logits/rejected": -1.0213671464834864,
1454
+ "mean_token_accuracy": 0.7187614095583558,
1455
+ "rewards/chosen": -0.012766179290275658,
1456
+ "rewards/rejected": -0.014406545395818284,
1457
+ "rewards/accuracies": 0.52625,
1458
+ "rewards/margins": 0.001640366151041235,
1459
+ "logps/chosen": -52.5052701497078,
1460
+ "logps/rejected": -53.90763850927353,
1461
+ "epoch": 0.7675950417509465,
1462
+ "step": 740
1463
+ },
1464
+ {
1465
+ "loss": 0.6922706127166748,
1466
+ "grad_norm": 0.009859760291874409,
1467
+ "learning_rate": 2.2383419689119174e-06,
1468
+ "entropy": 0.8285305345850066,
1469
+ "num_tokens": 50296449.0,
1470
+ "logits/chosen": -0.9801905178679585,
1471
+ "logits/rejected": -0.9738778555663805,
1472
+ "mean_token_accuracy": 0.723729298338294,
1473
+ "rewards/chosen": -0.009565252497509391,
1474
+ "rewards/rejected": -0.01175256536917459,
1475
+ "rewards/accuracies": 0.5175,
1476
+ "rewards/margins": 0.0021873128600418566,
1477
+ "logps/chosen": -54.38914824962616,
1478
+ "logps/rejected": -55.734090762138365,
1479
+ "epoch": 0.7779679477205539,
1480
+ "step": 750
1481
+ },
1482
+ {
1483
+ "eval_loss": 0.6926036477088928,
1484
+ "eval_runtime": 339.6814,
1485
+ "eval_samples_per_second": 2.944,
1486
+ "eval_steps_per_second": 2.944,
1487
+ "eval_entropy": 0.7968713178224862,
1488
+ "eval_num_tokens": 50296449.0,
1489
+ "eval_logits/chosen": -1.0377698264720323,
1490
+ "eval_logits/rejected": -0.9943464753298086,
1491
+ "eval_mean_token_accuracy": 0.7334770380109549,
1492
+ "eval_rewards/chosen": -0.012114850055493434,
1493
+ "eval_rewards/rejected": -0.013621491047078962,
1494
+ "eval_rewards/accuracies": 0.504,
1495
+ "eval_rewards/margins": 0.0015066410247527528,
1496
+ "eval_logps/chosen": -50.294135341644285,
1497
+ "eval_logps/rejected": -52.77608662986756,
1498
+ "epoch": 0.7779679477205539,
1499
+ "step": 750
1500
+ },
1501
+ {
1502
+ "train_runtime": 27561.1083,
1503
+ "train_samples_per_second": 2.798,
1504
+ "train_steps_per_second": 0.035,
1505
+ "total_flos": 4.075839588886364e+17,
1506
+ "train_loss": 0.6933243910471598,
1507
+ "epoch": 0.7779679477205539,
1508
+ "step": 750
1509
+ }
1510
+ ],
1511
+ "validation_monitor_size": 1000,
1512
+ "validation_monitor_selection": "fixed_seed_random_without_replacement",
1513
+ "validation_monitor_seed": 22,
1514
+ "validation_monitor_indices": [
1515
+ 2,
1516
+ 10,
1517
+ 14,
1518
+ 21,
1519
+ 55,
1520
+ 63,
1521
+ 66,
1522
+ 69,
1523
+ 107,
1524
+ 110,
1525
+ 142,
1526
+ 144,
1527
+ 149,
1528
+ 150,
1529
+ 151,
1530
+ 152,
1531
+ 160,
1532
+ 163,
1533
+ 166,
1534
+ 167,
1535
+ 176,
1536
+ 181,
1537
+ 206,
1538
+ 207,
1539
+ 259,
1540
+ 267,
1541
+ 281,
1542
+ 295,
1543
+ 298,
1544
+ 306,
1545
+ 307,
1546
+ 317,
1547
+ 321,
1548
+ 331,
1549
+ 336,
1550
+ 341,
1551
+ 346,
1552
+ 349,
1553
+ 351,
1554
+ 352,
1555
+ 357,
1556
+ 358,
1557
+ 369,
1558
+ 370,
1559
+ 382,
1560
+ 386,
1561
+ 391,
1562
+ 401,
1563
+ 411,
1564
+ 412,
1565
+ 432,
1566
+ 437,
1567
+ 452,
1568
+ 462,
1569
+ 465,
1570
+ 488,
1571
+ 490,
1572
+ 491,
1573
+ 492,
1574
+ 494,
1575
+ 503,
1576
+ 504,
1577
+ 508,
1578
+ 528,
1579
+ 538,
1580
+ 540,
1581
+ 551,
1582
+ 553,
1583
+ 567,
1584
+ 586,
1585
+ 605,
1586
+ 606,
1587
+ 625,
1588
+ 627,
1589
+ 661,
1590
+ 663,
1591
+ 666,
1592
+ 677,
1593
+ 685,
1594
+ 690,
1595
+ 692,
1596
+ 704,
1597
+ 708,
1598
+ 714,
1599
+ 715,
1600
+ 727,
1601
+ 728,
1602
+ 733,
1603
+ 745,
1604
+ 752,
1605
+ 753,
1606
+ 755,
1607
+ 764,
1608
+ 773,
1609
+ 779,
1610
+ 783,
1611
+ 793,
1612
+ 796,
1613
+ 799,
1614
+ 803,
1615
+ 804,
1616
+ 805,
1617
+ 813,
1618
+ 816,
1619
+ 818,
1620
+ 823,
1621
+ 827,
1622
+ 829,
1623
+ 830,
1624
+ 837,
1625
+ 842,
1626
+ 845,
1627
+ 850,
1628
+ 853,
1629
+ 856,
1630
+ 889,
1631
+ 890,
1632
+ 905,
1633
+ 915,
1634
+ 924,
1635
+ 930,
1636
+ 939,
1637
+ 951,
1638
+ 988,
1639
+ 1002,
1640
+ 1005,
1641
+ 1023,
1642
+ 1029,
1643
+ 1038,
1644
+ 1049,
1645
+ 1050,
1646
+ 1054,
1647
+ 1056,
1648
+ 1067,
1649
+ 1068,
1650
+ 1079,
1651
+ 1088,
1652
+ 1091,
1653
+ 1103,
1654
+ 1114,
1655
+ 1118,
1656
+ 1133,
1657
+ 1140,
1658
+ 1144,
1659
+ 1145,
1660
+ 1155,
1661
+ 1186,
1662
+ 1195,
1663
+ 1206,
1664
+ 1223,
1665
+ 1251,
1666
+ 1252,
1667
+ 1257,
1668
+ 1259,
1669
+ 1270,
1670
+ 1271,
1671
+ 1295,
1672
+ 1303,
1673
+ 1304,
1674
+ 1305,
1675
+ 1329,
1676
+ 1335,
1677
+ 1336,
1678
+ 1343,
1679
+ 1367,
1680
+ 1373,
1681
+ 1377,
1682
+ 1403,
1683
+ 1412,
1684
+ 1429,
1685
+ 1443,
1686
+ 1457,
1687
+ 1459,
1688
+ 1460,
1689
+ 1476,
1690
+ 1483,
1691
+ 1486,
1692
+ 1494,
1693
+ 1507,
1694
+ 1510,
1695
+ 1519,
1696
+ 1521,
1697
+ 1522,
1698
+ 1545,
1699
+ 1551,
1700
+ 1570,
1701
+ 1582,
1702
+ 1593,
1703
+ 1595,
1704
+ 1603,
1705
+ 1607,
1706
+ 1614,
1707
+ 1615,
1708
+ 1625,
1709
+ 1634,
1710
+ 1639,
1711
+ 1648,
1712
+ 1654,
1713
+ 1657,
1714
+ 1662,
1715
+ 1667,
1716
+ 1673,
1717
+ 1690,
1718
+ 1704,
1719
+ 1746,
1720
+ 1756,
1721
+ 1781,
1722
+ 1783,
1723
+ 1796,
1724
+ 1799,
1725
+ 1809,
1726
+ 1814,
1727
+ 1827,
1728
+ 1829,
1729
+ 1832,
1730
+ 1844,
1731
+ 1847,
1732
+ 1854,
1733
+ 1856,
1734
+ 1857,
1735
+ 1858,
1736
+ 1874,
1737
+ 1883,
1738
+ 1889,
1739
+ 1924,
1740
+ 1925,
1741
+ 1931,
1742
+ 1932,
1743
+ 1934,
1744
+ 1935,
1745
+ 1938,
1746
+ 1950,
1747
+ 1957,
1748
+ 1962,
1749
+ 1967,
1750
+ 1975,
1751
+ 1982,
1752
+ 1983,
1753
+ 1991,
1754
+ 1998,
1755
+ 2003,
1756
+ 2008,
1757
+ 2017,
1758
+ 2021,
1759
+ 2026,
1760
+ 2035,
1761
+ 2040,
1762
+ 2050,
1763
+ 2056,
1764
+ 2077,
1765
+ 2079,
1766
+ 2082,
1767
+ 2098,
1768
+ 2100,
1769
+ 2108,
1770
+ 2121,
1771
+ 2130,
1772
+ 2133,
1773
+ 2134,
1774
+ 2138,
1775
+ 2143,
1776
+ 2166,
1777
+ 2167,
1778
+ 2180,
1779
+ 2181,
1780
+ 2185,
1781
+ 2204,
1782
+ 2205,
1783
+ 2212,
1784
+ 2221,
1785
+ 2224,
1786
+ 2226,
1787
+ 2230,
1788
+ 2233,
1789
+ 2256,
1790
+ 2261,
1791
+ 2263,
1792
+ 2269,
1793
+ 2273,
1794
+ 2290,
1795
+ 2291,
1796
+ 2299,
1797
+ 2301,
1798
+ 2321,
1799
+ 2323,
1800
+ 2330,
1801
+ 2384,
1802
+ 2401,
1803
+ 2417,
1804
+ 2420,
1805
+ 2421,
1806
+ 2424,
1807
+ 2430,
1808
+ 2435,
1809
+ 2456,
1810
+ 2488,
1811
+ 2502,
1812
+ 2504,
1813
+ 2519,
1814
+ 2527,
1815
+ 2532,
1816
+ 2538,
1817
+ 2542,
1818
+ 2553,
1819
+ 2555,
1820
+ 2558,
1821
+ 2559,
1822
+ 2562,
1823
+ 2578,
1824
+ 2583,
1825
+ 2585,
1826
+ 2590,
1827
+ 2592,
1828
+ 2594,
1829
+ 2596,
1830
+ 2600,
1831
+ 2606,
1832
+ 2607,
1833
+ 2618,
1834
+ 2630,
1835
+ 2637,
1836
+ 2647,
1837
+ 2650,
1838
+ 2657,
1839
+ 2679,
1840
+ 2685,
1841
+ 2705,
1842
+ 2706,
1843
+ 2712,
1844
+ 2713,
1845
+ 2714,
1846
+ 2727,
1847
+ 2740,
1848
+ 2742,
1849
+ 2755,
1850
+ 2780,
1851
+ 2784,
1852
+ 2792,
1853
+ 2807,
1854
+ 2808,
1855
+ 2810,
1856
+ 2820,
1857
+ 2831,
1858
+ 2839,
1859
+ 2860,
1860
+ 2862,
1861
+ 2863,
1862
+ 2866,
1863
+ 2875,
1864
+ 2878,
1865
+ 2898,
1866
+ 2905,
1867
+ 2921,
1868
+ 2922,
1869
+ 2926,
1870
+ 2930,
1871
+ 2934,
1872
+ 2944,
1873
+ 2955,
1874
+ 2957,
1875
+ 2959,
1876
+ 2973,
1877
+ 2978,
1878
+ 2998,
1879
+ 3018,
1880
+ 3022,
1881
+ 3028,
1882
+ 3031,
1883
+ 3061,
1884
+ 3085,
1885
+ 3090,
1886
+ 3104,
1887
+ 3105,
1888
+ 3111,
1889
+ 3115,
1890
+ 3121,
1891
+ 3122,
1892
+ 3129,
1893
+ 3133,
1894
+ 3135,
1895
+ 3161,
1896
+ 3162,
1897
+ 3169,
1898
+ 3173,
1899
+ 3194,
1900
+ 3195,
1901
+ 3215,
1902
+ 3225,
1903
+ 3226,
1904
+ 3241,
1905
+ 3247,
1906
+ 3250,
1907
+ 3253,
1908
+ 3265,
1909
+ 3268,
1910
+ 3293,
1911
+ 3301,
1912
+ 3312,
1913
+ 3329,
1914
+ 3352,
1915
+ 3361,
1916
+ 3362,
1917
+ 3376,
1918
+ 3396,
1919
+ 3401,
1920
+ 3403,
1921
+ 3410,
1922
+ 3419,
1923
+ 3432,
1924
+ 3443,
1925
+ 3452,
1926
+ 3467,
1927
+ 3469,
1928
+ 3475,
1929
+ 3485,
1930
+ 3503,
1931
+ 3514,
1932
+ 3515,
1933
+ 3524,
1934
+ 3528,
1935
+ 3538,
1936
+ 3544,
1937
+ 3557,
1938
+ 3560,
1939
+ 3565,
1940
+ 3600,
1941
+ 3637,
1942
+ 3642,
1943
+ 3658,
1944
+ 3659,
1945
+ 3692,
1946
+ 3693,
1947
+ 3699,
1948
+ 3722,
1949
+ 3725,
1950
+ 3728,
1951
+ 3731,
1952
+ 3740,
1953
+ 3742,
1954
+ 3762,
1955
+ 3766,
1956
+ 3780,
1957
+ 3788,
1958
+ 3794,
1959
+ 3796,
1960
+ 3798,
1961
+ 3805,
1962
+ 3817,
1963
+ 3819,
1964
+ 3822,
1965
+ 3837,
1966
+ 3839,
1967
+ 3843,
1968
+ 3846,
1969
+ 3851,
1970
+ 3854,
1971
+ 3865,
1972
+ 3870,
1973
+ 3871,
1974
+ 3884,
1975
+ 3894,
1976
+ 3895,
1977
+ 3896,
1978
+ 3907,
1979
+ 3911,
1980
+ 3915,
1981
+ 3919,
1982
+ 3920,
1983
+ 3923,
1984
+ 3933,
1985
+ 3955,
1986
+ 3967,
1987
+ 3972,
1988
+ 3974,
1989
+ 3975,
1990
+ 3984,
1991
+ 3985,
1992
+ 3997,
1993
+ 4002,
1994
+ 4010,
1995
+ 4034,
1996
+ 4044,
1997
+ 4063,
1998
+ 4073,
1999
+ 4079,
2000
+ 4082,
2001
+ 4088,
2002
+ 4121,
2003
+ 4145,
2004
+ 4148,
2005
+ 4159,
2006
+ 4161,
2007
+ 4164,
2008
+ 4177,
2009
+ 4188,
2010
+ 4199,
2011
+ 4203,
2012
+ 4207,
2013
+ 4208,
2014
+ 4213,
2015
+ 4221,
2016
+ 4225,
2017
+ 4233,
2018
+ 4241,
2019
+ 4243,
2020
+ 4247,
2021
+ 4264,
2022
+ 4274,
2023
+ 4282,
2024
+ 4286,
2025
+ 4290,
2026
+ 4308,
2027
+ 4310,
2028
+ 4313,
2029
+ 4321,
2030
+ 4324,
2031
+ 4327,
2032
+ 4349,
2033
+ 4362,
2034
+ 4370,
2035
+ 4374,
2036
+ 4380,
2037
+ 4407,
2038
+ 4409,
2039
+ 4411,
2040
+ 4415,
2041
+ 4417,
2042
+ 4418,
2043
+ 4427,
2044
+ 4431,
2045
+ 4433,
2046
+ 4451,
2047
+ 4466,
2048
+ 4477,
2049
+ 4478,
2050
+ 4479,
2051
+ 4493,
2052
+ 4494,
2053
+ 4514,
2054
+ 4527,
2055
+ 4539,
2056
+ 4550,
2057
+ 4558,
2058
+ 4568,
2059
+ 4579,
2060
+ 4583,
2061
+ 4584,
2062
+ 4586,
2063
+ 4587,
2064
+ 4590,
2065
+ 4599,
2066
+ 4602,
2067
+ 4610,
2068
+ 4626,
2069
+ 4627,
2070
+ 4630,
2071
+ 4641,
2072
+ 4647,
2073
+ 4655,
2074
+ 4656,
2075
+ 4657,
2076
+ 4661,
2077
+ 4685,
2078
+ 4714,
2079
+ 4715,
2080
+ 4731,
2081
+ 4749,
2082
+ 4752,
2083
+ 4769,
2084
+ 4777,
2085
+ 4782,
2086
+ 4791,
2087
+ 4805,
2088
+ 4818,
2089
+ 4829,
2090
+ 4833,
2091
+ 4837,
2092
+ 4839,
2093
+ 4843,
2094
+ 4871,
2095
+ 4875,
2096
+ 4879,
2097
+ 4880,
2098
+ 4885,
2099
+ 4888,
2100
+ 4895,
2101
+ 4900,
2102
+ 4923,
2103
+ 4966,
2104
+ 4968,
2105
+ 4972,
2106
+ 4989,
2107
+ 4994,
2108
+ 4998,
2109
+ 5001,
2110
+ 5013,
2111
+ 5019,
2112
+ 5026,
2113
+ 5032,
2114
+ 5034,
2115
+ 5046,
2116
+ 5055,
2117
+ 5085,
2118
+ 5086,
2119
+ 5088,
2120
+ 5089,
2121
+ 5090,
2122
+ 5095,
2123
+ 5108,
2124
+ 5110,
2125
+ 5119,
2126
+ 5120,
2127
+ 5121,
2128
+ 5133,
2129
+ 5148,
2130
+ 5154,
2131
+ 5160,
2132
+ 5169,
2133
+ 5178,
2134
+ 5222,
2135
+ 5223,
2136
+ 5232,
2137
+ 5233,
2138
+ 5240,
2139
+ 5256,
2140
+ 5259,
2141
+ 5264,
2142
+ 5271,
2143
+ 5276,
2144
+ 5279,
2145
+ 5294,
2146
+ 5300,
2147
+ 5303,
2148
+ 5321,
2149
+ 5335,
2150
+ 5337,
2151
+ 5345,
2152
+ 5348,
2153
+ 5365,
2154
+ 5373,
2155
+ 5378,
2156
+ 5384,
2157
+ 5422,
2158
+ 5442,
2159
+ 5443,
2160
+ 5445,
2161
+ 5477,
2162
+ 5485,
2163
+ 5495,
2164
+ 5497,
2165
+ 5504,
2166
+ 5526,
2167
+ 5533,
2168
+ 5542,
2169
+ 5564,
2170
+ 5570,
2171
+ 5579,
2172
+ 5587,
2173
+ 5592,
2174
+ 5608,
2175
+ 5610,
2176
+ 5624,
2177
+ 5630,
2178
+ 5638,
2179
+ 5651,
2180
+ 5663,
2181
+ 5670,
2182
+ 5675,
2183
+ 5691,
2184
+ 5700,
2185
+ 5706,
2186
+ 5707,
2187
+ 5715,
2188
+ 5720,
2189
+ 5721,
2190
+ 5722,
2191
+ 5732,
2192
+ 5738,
2193
+ 5741,
2194
+ 5769,
2195
+ 5771,
2196
+ 5775,
2197
+ 5795,
2198
+ 5796,
2199
+ 5800,
2200
+ 5809,
2201
+ 5810,
2202
+ 5815,
2203
+ 5819,
2204
+ 5827,
2205
+ 5848,
2206
+ 5849,
2207
+ 5852,
2208
+ 5859,
2209
+ 5880,
2210
+ 5884,
2211
+ 5907,
2212
+ 5909,
2213
+ 5912,
2214
+ 5919,
2215
+ 5931,
2216
+ 5932,
2217
+ 5934,
2218
+ 5941,
2219
+ 5948,
2220
+ 5950,
2221
+ 5952,
2222
+ 5953,
2223
+ 5969,
2224
+ 5981,
2225
+ 6000,
2226
+ 6003,
2227
+ 6010,
2228
+ 6018,
2229
+ 6041,
2230
+ 6065,
2231
+ 6075,
2232
+ 6090,
2233
+ 6103,
2234
+ 6106,
2235
+ 6109,
2236
+ 6114,
2237
+ 6123,
2238
+ 6131,
2239
+ 6136,
2240
+ 6138,
2241
+ 6139,
2242
+ 6164,
2243
+ 6165,
2244
+ 6171,
2245
+ 6173,
2246
+ 6180,
2247
+ 6185,
2248
+ 6189,
2249
+ 6190,
2250
+ 6221,
2251
+ 6223,
2252
+ 6237,
2253
+ 6255,
2254
+ 6262,
2255
+ 6265,
2256
+ 6293,
2257
+ 6296,
2258
+ 6305,
2259
+ 6318,
2260
+ 6331,
2261
+ 6336,
2262
+ 6340,
2263
+ 6355,
2264
+ 6366,
2265
+ 6371,
2266
+ 6396,
2267
+ 6399,
2268
+ 6402,
2269
+ 6408,
2270
+ 6432,
2271
+ 6433,
2272
+ 6441,
2273
+ 6456,
2274
+ 6465,
2275
+ 6478,
2276
+ 6486,
2277
+ 6489,
2278
+ 6507,
2279
+ 6508,
2280
+ 6520,
2281
+ 6522,
2282
+ 6528,
2283
+ 6537,
2284
+ 6551,
2285
+ 6564,
2286
+ 6589,
2287
+ 6590,
2288
+ 6598,
2289
+ 6599,
2290
+ 6611,
2291
+ 6613,
2292
+ 6615,
2293
+ 6621,
2294
+ 6634,
2295
+ 6647,
2296
+ 6649,
2297
+ 6654,
2298
+ 6676,
2299
+ 6680,
2300
+ 6690,
2301
+ 6708,
2302
+ 6729,
2303
+ 6736,
2304
+ 6744,
2305
+ 6749,
2306
+ 6756,
2307
+ 6761,
2308
+ 6763,
2309
+ 6773,
2310
+ 6788,
2311
+ 6790,
2312
+ 6796,
2313
+ 6797,
2314
+ 6811,
2315
+ 6824,
2316
+ 6850,
2317
+ 6869,
2318
+ 6871,
2319
+ 6882,
2320
+ 6892,
2321
+ 6895,
2322
+ 6906,
2323
+ 6911,
2324
+ 6912,
2325
+ 6914,
2326
+ 6927,
2327
+ 6952,
2328
+ 6966,
2329
+ 6985,
2330
+ 7001,
2331
+ 7021,
2332
+ 7031,
2333
+ 7035,
2334
+ 7038,
2335
+ 7041,
2336
+ 7045,
2337
+ 7052,
2338
+ 7057,
2339
+ 7058,
2340
+ 7072,
2341
+ 7073,
2342
+ 7076,
2343
+ 7086,
2344
+ 7102,
2345
+ 7107,
2346
+ 7109,
2347
+ 7117,
2348
+ 7122,
2349
+ 7125,
2350
+ 7166,
2351
+ 7182,
2352
+ 7199,
2353
+ 7207,
2354
+ 7212,
2355
+ 7215,
2356
+ 7232,
2357
+ 7243,
2358
+ 7246,
2359
+ 7250,
2360
+ 7253,
2361
+ 7258,
2362
+ 7263,
2363
+ 7267,
2364
+ 7270,
2365
+ 7274,
2366
+ 7280,
2367
+ 7286,
2368
+ 7293,
2369
+ 7298,
2370
+ 7302,
2371
+ 7306,
2372
+ 7316,
2373
+ 7325,
2374
+ 7326,
2375
+ 7334,
2376
+ 7356,
2377
+ 7357,
2378
+ 7363,
2379
+ 7364,
2380
+ 7367,
2381
+ 7385,
2382
+ 7392,
2383
+ 7399,
2384
+ 7405,
2385
+ 7416,
2386
+ 7420,
2387
+ 7421,
2388
+ 7426,
2389
+ 7452,
2390
+ 7476,
2391
+ 7481,
2392
+ 7519,
2393
+ 7534,
2394
+ 7542,
2395
+ 7546,
2396
+ 7573,
2397
+ 7585,
2398
+ 7601,
2399
+ 7604,
2400
+ 7606,
2401
+ 7609,
2402
+ 7629,
2403
+ 7649,
2404
+ 7653,
2405
+ 7667,
2406
+ 7682,
2407
+ 7699,
2408
+ 7738,
2409
+ 7750,
2410
+ 7786,
2411
+ 7798,
2412
+ 7800,
2413
+ 7801,
2414
+ 7805,
2415
+ 7806,
2416
+ 7811,
2417
+ 7813,
2418
+ 7832,
2419
+ 7837,
2420
+ 7849,
2421
+ 7856,
2422
+ 7876,
2423
+ 7877,
2424
+ 7887,
2425
+ 7905,
2426
+ 7916,
2427
+ 7919,
2428
+ 7920,
2429
+ 7922,
2430
+ 7923,
2431
+ 7926,
2432
+ 7944,
2433
+ 7961,
2434
+ 7966,
2435
+ 7970,
2436
+ 7973,
2437
+ 7974,
2438
+ 7976,
2439
+ 7986,
2440
+ 7999,
2441
+ 8027,
2442
+ 8028,
2443
+ 8034,
2444
+ 8047,
2445
+ 8068,
2446
+ 8074,
2447
+ 8077,
2448
+ 8091,
2449
+ 8120,
2450
+ 8122,
2451
+ 8125,
2452
+ 8152,
2453
+ 8153,
2454
+ 8164,
2455
+ 8167,
2456
+ 8169,
2457
+ 8171,
2458
+ 8177,
2459
+ 8184,
2460
+ 8189,
2461
+ 8192,
2462
+ 8196,
2463
+ 8202,
2464
+ 8212,
2465
+ 8217,
2466
+ 8231,
2467
+ 8242,
2468
+ 8244,
2469
+ 8250,
2470
+ 8256,
2471
+ 8257,
2472
+ 8265,
2473
+ 8270,
2474
+ 8274,
2475
+ 8283,
2476
+ 8290,
2477
+ 8294,
2478
+ 8301,
2479
+ 8302,
2480
+ 8307,
2481
+ 8318,
2482
+ 8326,
2483
+ 8338,
2484
+ 8349,
2485
+ 8350,
2486
+ 8353,
2487
+ 8357,
2488
+ 8371,
2489
+ 8374,
2490
+ 8377,
2491
+ 8380,
2492
+ 8387,
2493
+ 8388,
2494
+ 8396,
2495
+ 8402,
2496
+ 8419,
2497
+ 8423,
2498
+ 8428,
2499
+ 8435,
2500
+ 8439,
2501
+ 8442,
2502
+ 8444,
2503
+ 8453,
2504
+ 8461,
2505
+ 8475,
2506
+ 8481,
2507
+ 8485,
2508
+ 8493,
2509
+ 8495,
2510
+ 8498,
2511
+ 8523,
2512
+ 8530,
2513
+ 8531,
2514
+ 8562
2515
+ ],
2516
+ "early_stopping_patience": 3
2517
+ }
phase1/ablations/shuffled_documents/README.md ADDED
@@ -0,0 +1,81 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: peft
3
+ model_name: phase1-qwen-shuffled-documents-ablation
4
+ tags:
5
+ - base_model:adapter:Qwen/Qwen2.5-1.5B-Instruct
6
+ - dpo
7
+ - lora
8
+ - transformers
9
+ - trl
10
+ license: apache-2.0
11
+ base_model: Qwen/Qwen2.5-1.5B-Instruct
12
+ pipeline_tag: text-generation
13
+ ---
14
+
15
+ # Phase 1 Qwen `shuffled_documents` diagnostic ablation
16
+
17
+ This is the Phase 1 `shuffled_documents` diagnostic LoRA-DPO adapter fine-tuned
18
+ from
19
+ [Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct).
20
+ The frozen training recipe and membership hashes are included in this directory.
21
+
22
+ ## Quick start
23
+
24
+ ```python
25
+ from peft import PeftModel
26
+ from transformers import AutoModelForCausalLM, AutoTokenizer
27
+
28
+ repo_id = "geyuxu/york-milestone-project-self-traing-loop-model"
29
+ subfolder = "phase1/ablations/shuffled_documents"
30
+ base_id = "Qwen/Qwen2.5-1.5B-Instruct"
31
+
32
+ tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder)
33
+ base_model = AutoModelForCausalLM.from_pretrained(
34
+ base_id, torch_dtype="auto", device_map="auto"
35
+ )
36
+ model = PeftModel.from_pretrained(base_model, repo_id, subfolder=subfolder)
37
+ ```
38
+
39
+ ## Training procedure
40
+
41
+
42
+
43
+
44
+
45
+ This model was trained with DPO, a method introduced in [Direct Preference Optimization: Your Language Model is Secretly a Reward Model](https://huggingface.co/papers/2305.18290).
46
+
47
+ ### Framework versions
48
+
49
+ - PEFT 0.18.1
50
+ - TRL: 0.29.0
51
+ - Transformers: 5.3.0
52
+ - Pytorch: 2.10.0
53
+ - Datasets: 4.6.1
54
+ - Tokenizers: 0.22.2
55
+
56
+ ## Citations
57
+
58
+ Cite DPO as:
59
+
60
+ ```bibtex
61
+ @inproceedings{rafailov2023direct,
62
+ title = {{Direct Preference Optimization: Your Language Model is Secretly a Reward Model}},
63
+ author = {Rafael Rafailov and Archit Sharma and Eric Mitchell and Christopher D. Manning and Stefano Ermon and Chelsea Finn},
64
+ year = 2023,
65
+ booktitle = {Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023},
66
+ url = {http://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html},
67
+ editor = {Alice Oh and Tristan Naumann and Amir Globerson and Kate Saenko and Moritz Hardt and Sergey Levine},
68
+ }
69
+ ```
70
+
71
+ Cite TRL as:
72
+
73
+ ```bibtex
74
+ @software{vonwerra2020trl,
75
+ title = {{TRL: Transformers Reinforcement Learning}},
76
+ author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin},
77
+ license = {Apache-2.0},
78
+ url = {https://github.com/huggingface/trl},
79
+ year = {2020}
80
+ }
81
+ ```
phase1/ablations/shuffled_documents/adapter_config.json ADDED
@@ -0,0 +1,43 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "Qwen/Qwen2.5-1.5B-Instruct",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 32,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "megatron_config": null,
23
+ "megatron_core": "megatron.core",
24
+ "modules_to_save": null,
25
+ "peft_type": "LORA",
26
+ "peft_version": "0.18.1",
27
+ "qalora_group_size": 16,
28
+ "r": 16,
29
+ "rank_pattern": {},
30
+ "revision": null,
31
+ "target_modules": [
32
+ "v_proj",
33
+ "k_proj",
34
+ "o_proj",
35
+ "q_proj"
36
+ ],
37
+ "target_parameters": null,
38
+ "task_type": "CAUSAL_LM",
39
+ "trainable_token_indices": null,
40
+ "use_dora": false,
41
+ "use_qalora": false,
42
+ "use_rslora": false
43
+ }