cryptobiosis commited on
Commit
3103783
·
verified ·
1 Parent(s): 653b06b

Add files using upload-large-folder tool

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
LICENSE ADDED
@@ -0,0 +1,201 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Apache License
2
+ Version 2.0, January 2004
3
+ http://www.apache.org/licenses/
4
+
5
+ TERMS AND CONDITIONS FOR USE, REPRODUCTION, AND DISTRIBUTION
6
+
7
+ 1. Definitions.
8
+
9
+ "License" shall mean the terms and conditions for use, reproduction,
10
+ and distribution as defined by Sections 1 through 9 of this document.
11
+
12
+ "Licensor" shall mean the copyright owner or entity authorized by
13
+ the copyright owner that is granting the License.
14
+
15
+ "Legal Entity" shall mean the union of the acting entity and all
16
+ other entities that control, are controlled by, or are under common
17
+ control with that entity. For the purposes of this definition,
18
+ "control" means (i) the power, direct or indirect, to cause the
19
+ direction or management of such entity, whether by contract or
20
+ otherwise, or (ii) ownership of fifty percent (50%) or more of the
21
+ outstanding shares, or (iii) beneficial ownership of such entity.
22
+
23
+ "You" (or "Your") shall mean an individual or Legal Entity
24
+ exercising permissions granted by this License.
25
+
26
+ "Source" form shall mean the preferred form for making modifications,
27
+ including but not limited to software source code, documentation
28
+ source, and configuration files.
29
+
30
+ "Object" form shall mean any form resulting from mechanical
31
+ transformation or translation of a Source form, including but
32
+ not limited to compiled object code, generated documentation,
33
+ and conversions to other media types.
34
+
35
+ "Work" shall mean the work of authorship, whether in Source or
36
+ Object form, made available under the License, as indicated by a
37
+ copyright notice that is included in or attached to the work
38
+ (an example is provided in the Appendix below).
39
+
40
+ "Derivative Works" shall mean any work, whether in Source or Object
41
+ form, that is based on (or derived from) the Work and for which the
42
+ editorial revisions, annotations, elaborations, or other modifications
43
+ represent, as a whole, an original work of authorship. For the purposes
44
+ of this License, Derivative Works shall not include works that remain
45
+ separable from, or merely link (or bind by name) to the interfaces of,
46
+ the Work and Derivative Works thereof.
47
+
48
+ "Contribution" shall mean any work of authorship, including
49
+ the original version of the Work and any modifications or additions
50
+ to that Work or Derivative Works thereof, that is intentionally
51
+ submitted to Licensor for inclusion in the Work by the copyright owner
52
+ or by an individual or Legal Entity authorized to submit on behalf of
53
+ the copyright owner. For the purposes of this definition, "submitted"
54
+ means any form of electronic, verbal, or written communication sent
55
+ to the Licensor or its representatives, including but not limited to
56
+ communication on electronic mailing lists, source code control systems,
57
+ and issue tracking systems that are managed by, or on behalf of, the
58
+ Licensor for the purpose of discussing and improving the Work, but
59
+ excluding communication that is conspicuously marked or otherwise
60
+ designated in writing by the copyright owner as "Not a Contribution."
61
+
62
+ "Contributor" shall mean Licensor and any individual or Legal Entity
63
+ on behalf of whom a Contribution has been received by Licensor and
64
+ subsequently incorporated within the Work.
65
+
66
+ 2. Grant of Copyright License. Subject to the terms and conditions of
67
+ this License, each Contributor hereby grants to You a perpetual,
68
+ worldwide, non-exclusive, no-charge, royalty-free, irrevocable
69
+ copyright license to reproduce, prepare Derivative Works of,
70
+ publicly display, publicly perform, sublicense, and distribute the
71
+ Work and such Derivative Works in Source or Object form.
72
+
73
+ 3. Grant of Patent License. Subject to the terms and conditions of
74
+ this License, each Contributor hereby grants to You a perpetual,
75
+ worldwide, non-exclusive, no-charge, royalty-free, irrevocable
76
+ (except as stated in this section) patent license to make, have made,
77
+ use, offer to sell, sell, import, and otherwise transfer the Work,
78
+ where such license applies only to those patent claims licensable
79
+ by such Contributor that are necessarily infringed by their
80
+ Contribution(s) alone or by combination of their Contribution(s)
81
+ with the Work to which such Contribution(s) was submitted. If You
82
+ institute patent litigation against any entity (including a
83
+ cross-claim or counterclaim in a lawsuit) alleging that the Work
84
+ or a Contribution incorporated within the Work constitutes direct
85
+ or contributory patent infringement, then any patent licenses
86
+ granted to You under this License for that Work shall terminate
87
+ as of the date such litigation is filed.
88
+
89
+ 4. Redistribution. You may reproduce and distribute copies of the
90
+ Work or Derivative Works thereof in any medium, with or without
91
+ modifications, and in Source or Object form, provided that You
92
+ meet the following conditions:
93
+
94
+ (a) You must give any other recipients of the Work or
95
+ Derivative Works a copy of this License; and
96
+
97
+ (b) You must cause any modified files to carry prominent notices
98
+ stating that You changed the files; and
99
+
100
+ (c) You must retain, in the Source form of any Derivative Works
101
+ that You distribute, all copyright, patent, trademark, and
102
+ attribution notices from the Source form of the Work,
103
+ excluding those notices that do not pertain to any part of
104
+ the Derivative Works; and
105
+
106
+ (d) If the Work includes a "NOTICE" text file as part of its
107
+ distribution, then any Derivative Works that You distribute must
108
+ include a readable copy of the attribution notices contained
109
+ within such NOTICE file, excluding those notices that do not
110
+ pertain to any part of the Derivative Works, in at least one
111
+ of the following places: within a NOTICE text file distributed
112
+ as part of the Derivative Works; within the Source form or
113
+ documentation, if provided along with the Derivative Works; or,
114
+ within a display generated by the Derivative Works, if and
115
+ wherever such third-party notices normally appear. The contents
116
+ of the NOTICE file are for informational purposes only and
117
+ do not modify the License. You may add Your own attribution
118
+ notices within Derivative Works that You distribute, alongside
119
+ or as an addendum to the NOTICE text from the Work, provided
120
+ that such additional attribution notices cannot be construed
121
+ as modifying the License.
122
+
123
+ You may add Your own copyright statement to Your modifications and
124
+ may provide additional or different license terms and conditions
125
+ for use, reproduction, or distribution of Your modifications, or
126
+ for any such Derivative Works as a whole, provided Your use,
127
+ reproduction, and distribution of the Work otherwise complies with
128
+ the conditions stated in this License.
129
+
130
+ 5. Submission of Contributions. Unless You explicitly state otherwise,
131
+ any Contribution intentionally submitted for inclusion in the Work
132
+ by You to the Licensor shall be under the terms and conditions of
133
+ this License, without any additional terms or conditions.
134
+ Notwithstanding the above, nothing herein shall supersede or modify
135
+ the terms of any separate license agreement you may have executed
136
+ with Licensor regarding such Contributions.
137
+
138
+ 6. Trademarks. This License does not grant permission to use the trade
139
+ names, trademarks, service marks, or product names of the Licensor,
140
+ except as required for reasonable and customary use in describing the
141
+ origin of the Work and reproducing the content of the NOTICE file.
142
+
143
+ 7. Disclaimer of Warranty. Unless required by applicable law or
144
+ agreed to in writing, Licensor provides the Work (and each
145
+ Contributor provides its Contributions) on an "AS IS" BASIS,
146
+ WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or
147
+ implied, including, without limitation, any warranties or conditions
148
+ of TITLE, NON-INFRINGEMENT, MERCHANTABILITY, or FITNESS FOR A
149
+ PARTICULAR PURPOSE. You are solely responsible for determining the
150
+ appropriateness of using or redistributing the Work and assume any
151
+ risks associated with Your exercise of permissions under this License.
152
+
153
+ 8. Limitation of Liability. In no event and under no legal theory,
154
+ whether in tort (including negligence), contract, or otherwise,
155
+ unless required by applicable law (such as deliberate and grossly
156
+ negligent acts) or agreed to in writing, shall any Contributor be
157
+ liable to You for damages, including any direct, indirect, special,
158
+ incidental, or consequential damages of any character arising as a
159
+ result of this License or out of the use or inability to use the
160
+ Work (including but not limited to damages for loss of goodwill,
161
+ work stoppage, computer failure or malfunction, or any and all
162
+ other commercial damages or losses), even if such Contributor
163
+ has been advised of the possibility of such damages.
164
+
165
+ 9. Accepting Warranty or Additional Liability. While redistributing
166
+ the Work or Derivative Works thereof, You may choose to offer,
167
+ and charge a fee for, acceptance of support, warranty, indemnity,
168
+ or other liability obligations and/or rights consistent with this
169
+ License. However, in accepting such obligations, You may act only
170
+ on Your own behalf and on Your sole responsibility, not on behalf
171
+ of any other Contributor, and only if You agree to indemnify,
172
+ defend, and hold each Contributor harmless for any liability
173
+ incurred by, or claims asserted against, such Contributor by reason
174
+ of your accepting any such warranty or additional liability.
175
+
176
+ END OF TERMS AND CONDITIONS
177
+
178
+ APPENDIX: How to apply the Apache License to your work.
179
+
180
+ To apply the Apache License to your work, attach the following
181
+ boilerplate notice, with the fields enclosed by brackets "{}"
182
+ replaced with your own identifying information. (Don't include
183
+ the brackets!) The text should be enclosed in the appropriate
184
+ comment syntax for the file format. We also recommend that a
185
+ file or class name and description of purpose be included on the
186
+ same "printed page" as the copyright notice for easier
187
+ identification within third-party archives.
188
+
189
+ Copyright {yyyy} {name of copyright owner}
190
+
191
+ Licensed under the Apache License, Version 2.0 (the "License");
192
+ you may not use this file except in compliance with the License.
193
+ You may obtain a copy of the License at
194
+
195
+ http://www.apache.org/licenses/LICENSE-2.0
196
+
197
+ Unless required by applicable law or agreed to in writing, software
198
+ distributed under the License is distributed on an "AS IS" BASIS,
199
+ WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
200
+ See the License for the specific language governing permissions and
201
+ limitations under the License.
NOTICE ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ Kakeya OProver LoRA derivative, 2026 FluffyAIcode.
2
+ Base model: m-a-p/OProver-8B, Apache-2.0, revision cd9ffd383b584d95bf00e04b88b35b05928b211c.
3
+ Training material derives from leanprover-community/mathlib4, Apache-2.0, revision 360da6fa66c1273b76b6b2d8c5666fd5ac2e3b56.
README.md ADDED
@@ -0,0 +1,93 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ base_model: m-a-p/OProver-8B
4
+ library_name: peft
5
+ pipeline_tag: text-generation
6
+ tags:
7
+ - lean
8
+ - lean4
9
+ - theorem-proving
10
+ - lora
11
+ - peft
12
+ ---
13
+
14
+ # Kakeya OProver Stage 3 — DPO
15
+
16
+ > **Status: NO-GO REGRESSION**
17
+
18
+ ## Summary
19
+
20
+ This is an independent PEFT LoRA checkpoint in the Kakeya OProver training journey. It is a proof-advisor research artifact, not an autonomous proof or mathematical truth claim.
21
+
22
+ ## Training Data
23
+
24
+ Public data config: [`dpo-2000`](https://huggingface.co/datasets/FluffyAIcode/Kakeya-OProver-Training). Artifact SHA-256: `2de80cfbb1c5e14c89611810e02b9f432ec2643a203e4c983cd48b1e6ad919a3`. Only Mathlib Apache-2.0 material and explicitly derived training negatives are included; provenance-incomplete OProofs mixtures were excluded.
25
+
26
+ ## Method
27
+
28
+ DPO on 1,400 training pairs and 200 validation pairs; 400 holdout pairs were excluded from training.
29
+
30
+ ## Strict Lean Evaluation
31
+
32
+ All matched Stage2–Stage4 evaluations used 22 tasks (18 holdout + 4 canary), one frozen task order, seed, temperature, token budget, and context policy. Parser rate was 22/22 and unsafe generations were 0 for matched evaluations.
33
+
34
+ ```json
35
+ {
36
+ "status": "NO-GO",
37
+ "all22": {
38
+ "corrected_exact": 4,
39
+ "n": 22,
40
+ "parser": 22,
41
+ "unsafe": 0
42
+ },
43
+ "holdout18": {
44
+ "corrected_exact": 1,
45
+ "n": 18
46
+ },
47
+ "canary4": {
48
+ "corrected_exact": 3,
49
+ "n": 4
50
+ },
51
+ "audit_sha256": "aeb63952d78a132cbe24f4c9238b1c305737c243a51e337c67d5ec08150fe391",
52
+ "comparison_payload_sha256": "837360593b1fdee9205166cf59d7d091b5992c33a8488d013b3283f6da5b7b8d",
53
+ "comparison_signature": {
54
+ "algorithm": "Ed25519",
55
+ "public_key_base64": "VEQy27ukhgP7vMlIFwRBVYBgXM0RvFXPrOmQ2cnLOmU=",
56
+ "signature_base64": "ZEVKmswS+H8sLkrVO3ZFi/OftAUACZNn7h4qH7F2EK2cGzniGMisvAtH/n8wziW5xf40/HylwBEh4HqNGrcmDg=="
57
+ },
58
+ "paired_stage2": {
59
+ "all22_mcnemar_exact_two_sided_p": 0.0625,
60
+ "holdout18_mcnemar_exact_two_sided_p": 0.125,
61
+ "interpretation": "Practically material and directionally strong regression, but not conclusive at alpha 0.05."
62
+ }
63
+ }
64
+ ```
65
+
66
+ ## Safety
67
+
68
+ No private chain-of-thought, production prompts, Jensen candidate proof bodies, credentials, or raw candidate-bearing signed audits are published. Stage status constrains use; Stage4 is **PROOF-ADVISOR-ONLY**.
69
+
70
+ ## Known Failures
71
+
72
+ Corrected strict validity regressed to 4/22 overall and 1/18 holdout. The paired Stage2 comparison was directionally strong but not significant at alpha 0.05.
73
+
74
+ ## Intended Use
75
+
76
+ Research on Lean proof suggestion, evaluation, and repair. Every generated proof must be compiled and independently reviewed. Not intended for unsupervised theorem claims or production deployment without separate authorization.
77
+
78
+ ## Reproducibility
79
+
80
+ - Base: [`m-a-p/OProver-8B`](https://huggingface.co/m-a-p/OProver-8B) at `cd9ffd383b584d95bf00e04b88b35b05928b211c`
81
+ - Immutable source revision: `c3b684ce7729ec94305deac4fbc5fd506c7f79a6`
82
+ - Adapter SHA-256: `064fb996230352ae12fd326944e8c5696edc22c36d34fc710805cb5aa2a3f9e3`
83
+ - Dataset artifact SHA-256: `2de80cfbb1c5e14c89611810e02b9f432ec2643a203e4c983cd48b1e6ad919a3`
84
+ - Sanitized machine-readable files: `evaluation/results.json`, `training/metrics.jsonl`, `training/trainer_state.json`, `provenance/manifest.json`
85
+ - Evaluation/audit digest references are in `evaluation/results.json`; raw candidate-bearing artifacts remain private.
86
+
87
+ ## Limitations
88
+
89
+ Small, single-seed strict suites cannot establish broad theorem-proving capability. Exact Lean rates have wide confidence intervals. Stage4 did not significantly outperform Stage2 in the matched paired test. Jensen remained `SEARCH_EXHAUSTED` with 0/6 Lean-valid candidates. **RH PROVED: NO.**
90
+
91
+ ## Attribution
92
+
93
+ Base model: m-a-p/OProver-8B (Apache-2.0). Training data derives from Mathlib at `360da6fa66c1273b76b6b2d8c5666fd5ac2e3b56` (Apache-2.0). See `NOTICE`.
adapter_config.json ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "m-a-p/OProver-8B",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 64,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "lora_ga_config": null,
23
+ "megatron_config": null,
24
+ "megatron_core": "megatron.core",
25
+ "modules_to_save": null,
26
+ "monteclora_config": null,
27
+ "peft_type": "LORA",
28
+ "peft_version": "0.20.0",
29
+ "qalora_group_size": 16,
30
+ "r": 32,
31
+ "rank_pattern": {},
32
+ "revision": null,
33
+ "target_modules": [
34
+ "gate_proj",
35
+ "q_proj",
36
+ "up_proj",
37
+ "v_proj",
38
+ "down_proj",
39
+ "o_proj",
40
+ "k_proj"
41
+ ],
42
+ "target_parameters": null,
43
+ "task_type": "CAUSAL_LM",
44
+ "trainable_token_indices": null,
45
+ "use_bdlora": null,
46
+ "use_dora": false,
47
+ "use_qalora": false,
48
+ "use_rslora": false,
49
+ "velora_config": null
50
+ }
adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:064fb996230352ae12fd326944e8c5696edc22c36d34fc710805cb5aa2a3f9e3
3
+ size 349243752
added_tokens.json ADDED
@@ -0,0 +1,57 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "</think>": 151668,
3
+ "</tool_call>": 151658,
4
+ "</tool_response>": 151666,
5
+ "<dream>": 151682,
6
+ "<dream_end>": 151684,
7
+ "<dream_start>": 151683,
8
+ "<im_end>": 151681,
9
+ "<im_patch>": 151679,
10
+ "<im_start>": 151680,
11
+ "<patch_end>": 151690,
12
+ "<patch_newline>": 151691,
13
+ "<patch_start>": 151689,
14
+ "<think>": 151667,
15
+ "<tool_call>": 151657,
16
+ "<tool_response>": 151665,
17
+ "<video_end>": 151688,
18
+ "<video_start>": 151687,
19
+ "<|BOT|>": 151670,
20
+ "<|CALL_END|>": 151672,
21
+ "<|CALL_START|>": 151671,
22
+ "<|EOT|>": 151669,
23
+ "<|IMG_END|>": 151676,
24
+ "<|IMG_START|>": 151675,
25
+ "<|MASK_1e69f|>": 151685,
26
+ "<|META_END|>": 151678,
27
+ "<|META_START|>": 151677,
28
+ "<|THINK_END|>": 151674,
29
+ "<|THINK_START|>": 151673,
30
+ "<|UNMASK_1e69f|>": 151686,
31
+ "<|box_end|>": 151649,
32
+ "<|box_start|>": 151648,
33
+ "<|endoftext|>": 151643,
34
+ "<|file_sep|>": 151664,
35
+ "<|fim_middle|>": 151660,
36
+ "<|fim_pad|>": 151662,
37
+ "<|fim_prefix|>": 151659,
38
+ "<|fim_suffix|>": 151661,
39
+ "<|im_end|>": 151645,
40
+ "<|im_start|>": 151644,
41
+ "<|image_pad|>": 151655,
42
+ "<|object_ref_end|>": 151647,
43
+ "<|object_ref_start|>": 151646,
44
+ "<|quad_end|>": 151651,
45
+ "<|quad_start|>": 151650,
46
+ "<|repo_name|>": 151663,
47
+ "<|video_pad|>": 151656,
48
+ "<|vision_end|>": 151653,
49
+ "<|vision_pad|>": 151654,
50
+ "<|vision_start|>": 151652,
51
+ "<|begin▁of▁mask|>": 151693,
52
+ "<|begin▁of▁sentence|>": 151692,
53
+ "<|end▁of▁mask|>": 151694,
54
+ "<|end▁of▁sentence|>": 151697,
55
+ "<|fim▁begin|>": 151695,
56
+ "<|fim▁hole|>": 151696
57
+ }
chat_template.jinja ADDED
@@ -0,0 +1,89 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0].role == 'system' %}
4
+ {{- messages[0].content + '\n\n' }}
5
+ {%- endif %}
6
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
7
+ {%- for tool in tools %}
8
+ {{- "\n" }}
9
+ {{- tool | tojson }}
10
+ {%- endfor %}
11
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
12
+ {%- else %}
13
+ {%- if messages[0].role == 'system' %}
14
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
15
+ {%- endif %}
16
+ {%- endif %}
17
+ {%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
18
+ {%- for message in messages[::-1] %}
19
+ {%- set index = (messages|length - 1) - loop.index0 %}
20
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('<tool_response>') and message.content.endswith('</tool_response>')) %}
21
+ {%- set ns.multi_step_tool = false %}
22
+ {%- set ns.last_query_index = index %}
23
+ {%- endif %}
24
+ {%- endfor %}
25
+ {%- for message in messages %}
26
+ {%- if message.content is string %}
27
+ {%- set content = message.content %}
28
+ {%- else %}
29
+ {%- set content = '' %}
30
+ {%- endif %}
31
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
32
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
33
+ {%- elif message.role == "assistant" %}
34
+ {%- set reasoning_content = '' %}
35
+ {%- if message.reasoning_content is string %}
36
+ {%- set reasoning_content = message.reasoning_content %}
37
+ {%- else %}
38
+ {%- if '</think>' in content %}
39
+ {%- set reasoning_content = content.split('</think>')[0].rstrip('\n').split('<think>')[-1].lstrip('\n') %}
40
+ {%- set content = content.split('</think>')[-1].lstrip('\n') %}
41
+ {%- endif %}
42
+ {%- endif %}
43
+ {%- if loop.index0 > ns.last_query_index %}
44
+ {%- if loop.last or (not loop.last and reasoning_content) %}
45
+ {{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content.strip('\n') + '\n</think>\n\n' + content.lstrip('\n') }}
46
+ {%- else %}
47
+ {{- '<|im_start|>' + message.role + '\n' + content }}
48
+ {%- endif %}
49
+ {%- else %}
50
+ {{- '<|im_start|>' + message.role + '\n' + content }}
51
+ {%- endif %}
52
+ {%- if message.tool_calls %}
53
+ {%- for tool_call in message.tool_calls %}
54
+ {%- if (loop.first and content) or (not loop.first) %}
55
+ {{- '\n' }}
56
+ {%- endif %}
57
+ {%- if tool_call.function %}
58
+ {%- set tool_call = tool_call.function %}
59
+ {%- endif %}
60
+ {{- '<tool_call>\n{"name": "' }}
61
+ {{- tool_call.name }}
62
+ {{- '", "arguments": ' }}
63
+ {%- if tool_call.arguments is string %}
64
+ {{- tool_call.arguments }}
65
+ {%- else %}
66
+ {{- tool_call.arguments | tojson }}
67
+ {%- endif %}
68
+ {{- '}\n</tool_call>' }}
69
+ {%- endfor %}
70
+ {%- endif %}
71
+ {{- '<|im_end|>\n' }}
72
+ {%- elif message.role == "tool" %}
73
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
74
+ {{- '<|im_start|>user' }}
75
+ {%- endif %}
76
+ {{- '\n<tool_response>\n' }}
77
+ {{- content }}
78
+ {{- '\n</tool_response>' }}
79
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
80
+ {{- '<|im_end|>\n' }}
81
+ {%- endif %}
82
+ {%- endif %}
83
+ {%- endfor %}
84
+ {%- if add_generation_prompt %}
85
+ {{- '<|im_start|>assistant\n' }}
86
+ {%- if enable_thinking is defined and enable_thinking is false %}
87
+ {{- '<think>\n\n</think>\n\n' }}
88
+ {%- endif %}
89
+ {%- endif %}
evaluation/results.json ADDED
@@ -0,0 +1,29 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "status": "NO-GO",
3
+ "all22": {
4
+ "corrected_exact": 4,
5
+ "n": 22,
6
+ "parser": 22,
7
+ "unsafe": 0
8
+ },
9
+ "holdout18": {
10
+ "corrected_exact": 1,
11
+ "n": 18
12
+ },
13
+ "canary4": {
14
+ "corrected_exact": 3,
15
+ "n": 4
16
+ },
17
+ "audit_sha256": "aeb63952d78a132cbe24f4c9238b1c305737c243a51e337c67d5ec08150fe391",
18
+ "comparison_payload_sha256": "837360593b1fdee9205166cf59d7d091b5992c33a8488d013b3283f6da5b7b8d",
19
+ "comparison_signature": {
20
+ "algorithm": "Ed25519",
21
+ "public_key_base64": "VEQy27ukhgP7vMlIFwRBVYBgXM0RvFXPrOmQ2cnLOmU=",
22
+ "signature_base64": "ZEVKmswS+H8sLkrVO3ZFi/OftAUACZNn7h4qH7F2EK2cGzniGMisvAtH/n8wziW5xf40/HylwBEh4HqNGrcmDg=="
23
+ },
24
+ "paired_stage2": {
25
+ "all22_mcnemar_exact_two_sided_p": 0.0625,
26
+ "holdout18_mcnemar_exact_two_sided_p": 0.125,
27
+ "interpretation": "Practically material and directionally strong regression, but not conclusive at alpha 0.05."
28
+ }
29
+ }
merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
provenance/manifest.json ADDED
@@ -0,0 +1,26 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "schema_version": 1,
3
+ "public_repo": "FluffyAIcode/Kakeya-OProver-Stage3-DPO",
4
+ "base_model": "m-a-p/OProver-8B",
5
+ "base_revision": "cd9ffd383b584d95bf00e04b88b35b05928b211c",
6
+ "source_private_repo": "FluffyAIcode/oprover-8b-mathlib-lora-stage1",
7
+ "source_immutable_revision": "c3b684ce7729ec94305deac4fbc5fd506c7f79a6",
8
+ "adapter_sha256": "064fb996230352ae12fd326944e8c5696edc22c36d34fc710805cb5aa2a3f9e3",
9
+ "dataset_artifact_sha256": "2de80cfbb1c5e14c89611810e02b9f432ec2643a203e4c983cd48b1e6ad919a3",
10
+ "public_private_boundary": {
11
+ "public": [
12
+ "adapter",
13
+ "tokenizer",
14
+ "sanitized metrics/trainer state",
15
+ "aggregate strict evaluation",
16
+ "hashes/signatures/config"
17
+ ],
18
+ "private": [
19
+ "chain-of-thought",
20
+ "production prompts",
21
+ "Jensen candidate proof bodies",
22
+ "raw candidate-bearing signed audits",
23
+ "optimizer and RNG checkpoints"
24
+ ]
25
+ }
26
+ }
special_tokens_map.json ADDED
@@ -0,0 +1,47 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "additional_special_tokens": [
3
+ "<|EOT|>",
4
+ "<|BOT|>",
5
+ "<|CALL_START|>",
6
+ "<|CALL_END|>",
7
+ "<|THINK_START|>",
8
+ "<|THINK_END|>",
9
+ "<|IMG_START|>",
10
+ "<|IMG_END|>",
11
+ "<|META_START|>",
12
+ "<|META_END|>",
13
+ "<im_patch>",
14
+ "<im_start>",
15
+ "<im_end>",
16
+ "<dream>",
17
+ "<dream_start>",
18
+ "<dream_end>",
19
+ "<|MASK_1e69f|>",
20
+ "<|UNMASK_1e69f|>",
21
+ "<video_start>",
22
+ "<video_end>",
23
+ "<patch_start>",
24
+ "<patch_end>",
25
+ "<patch_newline>",
26
+ "<|begin▁of▁sentence|>",
27
+ "<|begin▁of▁mask|>",
28
+ "<|end▁of▁mask|>",
29
+ "<|fim▁begin|>",
30
+ "<|fim▁hole|>",
31
+ "<|end▁of▁sentence|>"
32
+ ],
33
+ "eos_token": {
34
+ "content": "<|im_end|>",
35
+ "lstrip": false,
36
+ "normalized": false,
37
+ "rstrip": false,
38
+ "single_word": false
39
+ },
40
+ "pad_token": {
41
+ "content": "<|endoftext|>",
42
+ "lstrip": false,
43
+ "normalized": false,
44
+ "rstrip": false,
45
+ "single_word": false
46
+ }
47
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:217e7242c0cafb50790f703bb14e062966b997a1bc8dc980e11240f5f1d06d27
3
+ size 11428198
tokenizer_config.json ADDED
@@ -0,0 +1,487 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_bos_token": false,
3
+ "add_prefix_space": false,
4
+ "added_tokens_decoder": {
5
+ "151643": {
6
+ "content": "<|endoftext|>",
7
+ "lstrip": false,
8
+ "normalized": false,
9
+ "rstrip": false,
10
+ "single_word": false,
11
+ "special": true
12
+ },
13
+ "151644": {
14
+ "content": "<|im_start|>",
15
+ "lstrip": false,
16
+ "normalized": false,
17
+ "rstrip": false,
18
+ "single_word": false,
19
+ "special": true
20
+ },
21
+ "151645": {
22
+ "content": "<|im_end|>",
23
+ "lstrip": false,
24
+ "normalized": false,
25
+ "rstrip": false,
26
+ "single_word": false,
27
+ "special": true
28
+ },
29
+ "151646": {
30
+ "content": "<|object_ref_start|>",
31
+ "lstrip": false,
32
+ "normalized": false,
33
+ "rstrip": false,
34
+ "single_word": false,
35
+ "special": true
36
+ },
37
+ "151647": {
38
+ "content": "<|object_ref_end|>",
39
+ "lstrip": false,
40
+ "normalized": false,
41
+ "rstrip": false,
42
+ "single_word": false,
43
+ "special": true
44
+ },
45
+ "151648": {
46
+ "content": "<|box_start|>",
47
+ "lstrip": false,
48
+ "normalized": false,
49
+ "rstrip": false,
50
+ "single_word": false,
51
+ "special": true
52
+ },
53
+ "151649": {
54
+ "content": "<|box_end|>",
55
+ "lstrip": false,
56
+ "normalized": false,
57
+ "rstrip": false,
58
+ "single_word": false,
59
+ "special": true
60
+ },
61
+ "151650": {
62
+ "content": "<|quad_start|>",
63
+ "lstrip": false,
64
+ "normalized": false,
65
+ "rstrip": false,
66
+ "single_word": false,
67
+ "special": true
68
+ },
69
+ "151651": {
70
+ "content": "<|quad_end|>",
71
+ "lstrip": false,
72
+ "normalized": false,
73
+ "rstrip": false,
74
+ "single_word": false,
75
+ "special": true
76
+ },
77
+ "151652": {
78
+ "content": "<|vision_start|>",
79
+ "lstrip": false,
80
+ "normalized": false,
81
+ "rstrip": false,
82
+ "single_word": false,
83
+ "special": true
84
+ },
85
+ "151653": {
86
+ "content": "<|vision_end|>",
87
+ "lstrip": false,
88
+ "normalized": false,
89
+ "rstrip": false,
90
+ "single_word": false,
91
+ "special": true
92
+ },
93
+ "151654": {
94
+ "content": "<|vision_pad|>",
95
+ "lstrip": false,
96
+ "normalized": false,
97
+ "rstrip": false,
98
+ "single_word": false,
99
+ "special": true
100
+ },
101
+ "151655": {
102
+ "content": "<|image_pad|>",
103
+ "lstrip": false,
104
+ "normalized": false,
105
+ "rstrip": false,
106
+ "single_word": false,
107
+ "special": true
108
+ },
109
+ "151656": {
110
+ "content": "<|video_pad|>",
111
+ "lstrip": false,
112
+ "normalized": false,
113
+ "rstrip": false,
114
+ "single_word": false,
115
+ "special": true
116
+ },
117
+ "151657": {
118
+ "content": "<tool_call>",
119
+ "lstrip": false,
120
+ "normalized": false,
121
+ "rstrip": false,
122
+ "single_word": false,
123
+ "special": false
124
+ },
125
+ "151658": {
126
+ "content": "</tool_call>",
127
+ "lstrip": false,
128
+ "normalized": false,
129
+ "rstrip": false,
130
+ "single_word": false,
131
+ "special": false
132
+ },
133
+ "151659": {
134
+ "content": "<|fim_prefix|>",
135
+ "lstrip": false,
136
+ "normalized": false,
137
+ "rstrip": false,
138
+ "single_word": false,
139
+ "special": false
140
+ },
141
+ "151660": {
142
+ "content": "<|fim_middle|>",
143
+ "lstrip": false,
144
+ "normalized": false,
145
+ "rstrip": false,
146
+ "single_word": false,
147
+ "special": false
148
+ },
149
+ "151661": {
150
+ "content": "<|fim_suffix|>",
151
+ "lstrip": false,
152
+ "normalized": false,
153
+ "rstrip": false,
154
+ "single_word": false,
155
+ "special": false
156
+ },
157
+ "151662": {
158
+ "content": "<|fim_pad|>",
159
+ "lstrip": false,
160
+ "normalized": false,
161
+ "rstrip": false,
162
+ "single_word": false,
163
+ "special": false
164
+ },
165
+ "151663": {
166
+ "content": "<|repo_name|>",
167
+ "lstrip": false,
168
+ "normalized": false,
169
+ "rstrip": false,
170
+ "single_word": false,
171
+ "special": false
172
+ },
173
+ "151664": {
174
+ "content": "<|file_sep|>",
175
+ "lstrip": false,
176
+ "normalized": false,
177
+ "rstrip": false,
178
+ "single_word": false,
179
+ "special": false
180
+ },
181
+ "151665": {
182
+ "content": "<tool_response>",
183
+ "lstrip": false,
184
+ "normalized": false,
185
+ "rstrip": false,
186
+ "single_word": false,
187
+ "special": false
188
+ },
189
+ "151666": {
190
+ "content": "</tool_response>",
191
+ "lstrip": false,
192
+ "normalized": false,
193
+ "rstrip": false,
194
+ "single_word": false,
195
+ "special": false
196
+ },
197
+ "151667": {
198
+ "content": "<think>",
199
+ "lstrip": false,
200
+ "normalized": false,
201
+ "rstrip": false,
202
+ "single_word": false,
203
+ "special": false
204
+ },
205
+ "151668": {
206
+ "content": "</think>",
207
+ "lstrip": false,
208
+ "normalized": false,
209
+ "rstrip": false,
210
+ "single_word": false,
211
+ "special": false
212
+ },
213
+ "151669": {
214
+ "content": "<|EOT|>",
215
+ "lstrip": false,
216
+ "normalized": false,
217
+ "rstrip": false,
218
+ "single_word": false,
219
+ "special": true
220
+ },
221
+ "151670": {
222
+ "content": "<|BOT|>",
223
+ "lstrip": false,
224
+ "normalized": false,
225
+ "rstrip": false,
226
+ "single_word": false,
227
+ "special": true
228
+ },
229
+ "151671": {
230
+ "content": "<|CALL_START|>",
231
+ "lstrip": false,
232
+ "normalized": false,
233
+ "rstrip": false,
234
+ "single_word": false,
235
+ "special": true
236
+ },
237
+ "151672": {
238
+ "content": "<|CALL_END|>",
239
+ "lstrip": false,
240
+ "normalized": false,
241
+ "rstrip": false,
242
+ "single_word": false,
243
+ "special": true
244
+ },
245
+ "151673": {
246
+ "content": "<|THINK_START|>",
247
+ "lstrip": false,
248
+ "normalized": false,
249
+ "rstrip": false,
250
+ "single_word": false,
251
+ "special": true
252
+ },
253
+ "151674": {
254
+ "content": "<|THINK_END|>",
255
+ "lstrip": false,
256
+ "normalized": false,
257
+ "rstrip": false,
258
+ "single_word": false,
259
+ "special": true
260
+ },
261
+ "151675": {
262
+ "content": "<|IMG_START|>",
263
+ "lstrip": false,
264
+ "normalized": false,
265
+ "rstrip": false,
266
+ "single_word": false,
267
+ "special": true
268
+ },
269
+ "151676": {
270
+ "content": "<|IMG_END|>",
271
+ "lstrip": false,
272
+ "normalized": false,
273
+ "rstrip": false,
274
+ "single_word": false,
275
+ "special": true
276
+ },
277
+ "151677": {
278
+ "content": "<|META_START|>",
279
+ "lstrip": false,
280
+ "normalized": false,
281
+ "rstrip": false,
282
+ "single_word": false,
283
+ "special": true
284
+ },
285
+ "151678": {
286
+ "content": "<|META_END|>",
287
+ "lstrip": false,
288
+ "normalized": false,
289
+ "rstrip": false,
290
+ "single_word": false,
291
+ "special": true
292
+ },
293
+ "151679": {
294
+ "content": "<im_patch>",
295
+ "lstrip": false,
296
+ "normalized": false,
297
+ "rstrip": false,
298
+ "single_word": false,
299
+ "special": true
300
+ },
301
+ "151680": {
302
+ "content": "<im_start>",
303
+ "lstrip": false,
304
+ "normalized": false,
305
+ "rstrip": false,
306
+ "single_word": false,
307
+ "special": true
308
+ },
309
+ "151681": {
310
+ "content": "<im_end>",
311
+ "lstrip": false,
312
+ "normalized": false,
313
+ "rstrip": false,
314
+ "single_word": false,
315
+ "special": true
316
+ },
317
+ "151682": {
318
+ "content": "<dream>",
319
+ "lstrip": false,
320
+ "normalized": false,
321
+ "rstrip": false,
322
+ "single_word": false,
323
+ "special": true
324
+ },
325
+ "151683": {
326
+ "content": "<dream_start>",
327
+ "lstrip": false,
328
+ "normalized": false,
329
+ "rstrip": false,
330
+ "single_word": false,
331
+ "special": true
332
+ },
333
+ "151684": {
334
+ "content": "<dream_end>",
335
+ "lstrip": false,
336
+ "normalized": false,
337
+ "rstrip": false,
338
+ "single_word": false,
339
+ "special": true
340
+ },
341
+ "151685": {
342
+ "content": "<|MASK_1e69f|>",
343
+ "lstrip": false,
344
+ "normalized": false,
345
+ "rstrip": false,
346
+ "single_word": false,
347
+ "special": true
348
+ },
349
+ "151686": {
350
+ "content": "<|UNMASK_1e69f|>",
351
+ "lstrip": false,
352
+ "normalized": false,
353
+ "rstrip": false,
354
+ "single_word": false,
355
+ "special": true
356
+ },
357
+ "151687": {
358
+ "content": "<video_start>",
359
+ "lstrip": false,
360
+ "normalized": false,
361
+ "rstrip": false,
362
+ "single_word": false,
363
+ "special": true
364
+ },
365
+ "151688": {
366
+ "content": "<video_end>",
367
+ "lstrip": false,
368
+ "normalized": false,
369
+ "rstrip": false,
370
+ "single_word": false,
371
+ "special": true
372
+ },
373
+ "151689": {
374
+ "content": "<patch_start>",
375
+ "lstrip": false,
376
+ "normalized": false,
377
+ "rstrip": false,
378
+ "single_word": false,
379
+ "special": true
380
+ },
381
+ "151690": {
382
+ "content": "<patch_end>",
383
+ "lstrip": false,
384
+ "normalized": false,
385
+ "rstrip": false,
386
+ "single_word": false,
387
+ "special": true
388
+ },
389
+ "151691": {
390
+ "content": "<patch_newline>",
391
+ "lstrip": false,
392
+ "normalized": false,
393
+ "rstrip": false,
394
+ "single_word": false,
395
+ "special": true
396
+ },
397
+ "151692": {
398
+ "content": "<|begin▁of▁sentence|>",
399
+ "lstrip": false,
400
+ "normalized": false,
401
+ "rstrip": false,
402
+ "single_word": false,
403
+ "special": true
404
+ },
405
+ "151693": {
406
+ "content": "<|begin▁of▁mask|>",
407
+ "lstrip": false,
408
+ "normalized": false,
409
+ "rstrip": false,
410
+ "single_word": false,
411
+ "special": true
412
+ },
413
+ "151694": {
414
+ "content": "<|end▁of▁mask|>",
415
+ "lstrip": false,
416
+ "normalized": false,
417
+ "rstrip": false,
418
+ "single_word": false,
419
+ "special": true
420
+ },
421
+ "151695": {
422
+ "content": "<|fim▁begin|>",
423
+ "lstrip": false,
424
+ "normalized": false,
425
+ "rstrip": false,
426
+ "single_word": false,
427
+ "special": true
428
+ },
429
+ "151696": {
430
+ "content": "<|fim▁hole|>",
431
+ "lstrip": false,
432
+ "normalized": false,
433
+ "rstrip": false,
434
+ "single_word": false,
435
+ "special": true
436
+ },
437
+ "151697": {
438
+ "content": "<|end▁of▁sentence|>",
439
+ "lstrip": false,
440
+ "normalized": false,
441
+ "rstrip": false,
442
+ "single_word": false,
443
+ "special": true
444
+ }
445
+ },
446
+ "additional_special_tokens": [
447
+ "<|EOT|>",
448
+ "<|BOT|>",
449
+ "<|CALL_START|>",
450
+ "<|CALL_END|>",
451
+ "<|THINK_START|>",
452
+ "<|THINK_END|>",
453
+ "<|IMG_START|>",
454
+ "<|IMG_END|>",
455
+ "<|META_START|>",
456
+ "<|META_END|>",
457
+ "<im_patch>",
458
+ "<im_start>",
459
+ "<im_end>",
460
+ "<dream>",
461
+ "<dream_start>",
462
+ "<dream_end>",
463
+ "<|MASK_1e69f|>",
464
+ "<|UNMASK_1e69f|>",
465
+ "<video_start>",
466
+ "<video_end>",
467
+ "<patch_start>",
468
+ "<patch_end>",
469
+ "<patch_newline>",
470
+ "<|begin▁of▁sentence|>",
471
+ "<|begin▁of▁mask|>",
472
+ "<|end▁of▁mask|>",
473
+ "<|fim▁begin|>",
474
+ "<|fim▁hole|>",
475
+ "<|end▁of▁sentence|>"
476
+ ],
477
+ "bos_token": null,
478
+ "clean_up_tokenization_spaces": false,
479
+ "eos_token": "<|im_end|>",
480
+ "errors": "replace",
481
+ "extra_special_tokens": {},
482
+ "model_max_length": 131072,
483
+ "pad_token": "<|endoftext|>",
484
+ "split_special_tokens": false,
485
+ "tokenizer_class": "Qwen2Tokenizer",
486
+ "unk_token": null
487
+ }
training/metrics.jsonl ADDED
@@ -0,0 +1,93 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"epoch": 0.011428571428571429, "grad_norm": 5.672101974487305, "learning_rate": 0.0, "logits/chosen": -0.003827691078186035, "logits/rejected": 1.6622543334960938, "logps/chosen": -53.823280334472656, "logps/rejected": -83.19792175292969, "loss": 0.6931, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1}
2
+ {"epoch": 0.022857142857142857, "grad_norm": 5.676645755767822, "learning_rate": 1.0000000000000002e-06, "logits/chosen": -0.23317879438400269, "logits/rejected": 1.487736701965332, "logps/chosen": -105.3038101196289, "logps/rejected": -72.62786102294922, "loss": 0.6931, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2}
3
+ {"epoch": 0.03428571428571429, "grad_norm": 5.494569778442383, "learning_rate": 2.0000000000000003e-06, "logits/chosen": -0.34497007727622986, "logits/rejected": 1.3572413921356201, "logps/chosen": -78.18315124511719, "logps/rejected": -92.42572021484375, "loss": 0.6925, "rewards/accuracies": 0.5, "rewards/chosen": -0.010104288347065449, "rewards/margins": 0.001475572120398283, "rewards/rejected": -0.011579860001802444, "step": 3}
4
+ {"epoch": 0.045714285714285714, "grad_norm": 5.875666618347168, "learning_rate": 3e-06, "logits/chosen": 0.0768582671880722, "logits/rejected": 1.793702244758606, "logps/chosen": -49.45244598388672, "logps/rejected": -70.34400939941406, "loss": 0.6824, "rewards/accuracies": 0.75, "rewards/chosen": -0.006157493684440851, "rewards/margins": 0.02201489359140396, "rewards/rejected": -0.028172386810183525, "step": 4}
5
+ {"epoch": 0.05714285714285714, "grad_norm": 4.4969987869262695, "learning_rate": 4.000000000000001e-06, "logits/chosen": 0.29756978154182434, "logits/rejected": 1.5599043369293213, "logps/chosen": -38.330902099609375, "logps/rejected": -58.7880859375, "loss": 0.6602, "rewards/accuracies": 1.0, "rewards/chosen": 0.0054547907784581184, "rewards/margins": 0.06765428930521011, "rewards/rejected": -0.06219949945807457, "step": 5}
6
+ {"epoch": 0.06857142857142857, "grad_norm": 5.193802356719971, "learning_rate": 5e-06, "logits/chosen": -0.097133569419384, "logits/rejected": 1.5903254747390747, "logps/chosen": -71.06304168701172, "logps/rejected": -69.80386352539062, "loss": 0.6118, "rewards/accuracies": 0.9375, "rewards/chosen": 0.02022118680179119, "rewards/margins": 0.1755855232477188, "rewards/rejected": -0.15536434948444366, "step": 6}
7
+ {"epoch": 0.08, "grad_norm": 4.568131446838379, "learning_rate": 4.998209387040829e-06, "logits/chosen": 0.22878801822662354, "logits/rejected": 1.2406954765319824, "logps/chosen": -65.77464294433594, "logps/rejected": -70.03345489501953, "loss": 0.5809, "rewards/accuracies": 1.0, "rewards/chosen": 0.008165514096617699, "rewards/margins": 0.2519247233867645, "rewards/rejected": -0.2437591850757599, "step": 7}
8
+ {"epoch": 0.09142857142857143, "grad_norm": 3.668226480484009, "learning_rate": 4.992840113199131e-06, "logits/chosen": -0.06199551001191139, "logits/rejected": 1.0075984001159668, "logps/chosen": -31.54962158203125, "logps/rejected": -48.84445571899414, "loss": 0.5925, "rewards/accuracies": 1.0, "rewards/chosen": 0.006166815757751465, "rewards/margins": 0.21949976682662964, "rewards/rejected": -0.21333293616771698, "step": 8}
9
+ {"epoch": 0.10285714285714286, "grad_norm": 4.007819652557373, "learning_rate": 4.983899869907963e-06, "logits/chosen": 0.04794704169034958, "logits/rejected": 1.0474152565002441, "logps/chosen": -74.90632629394531, "logps/rejected": -68.87115478515625, "loss": 0.5221, "rewards/accuracies": 1.0, "rewards/chosen": 0.017194844782352448, "rewards/margins": 0.40241336822509766, "rewards/rejected": -0.3852185010910034, "step": 9}
10
+ {"epoch": 0.11428571428571428, "grad_norm": 4.3215508460998535, "learning_rate": 4.971401463979722e-06, "logits/chosen": 0.11494935303926468, "logits/rejected": 1.1323603391647339, "logps/chosen": -57.83014678955078, "logps/rejected": -69.66509246826172, "loss": 0.4632, "rewards/accuracies": 1.0, "rewards/chosen": 0.035677470266819, "rewards/margins": 0.5738754868507385, "rewards/rejected": -0.5381979942321777, "step": 10}
11
+ {"epoch": 0.12571428571428572, "grad_norm": 3.5642457008361816, "learning_rate": 4.955362799260507e-06, "logits/chosen": -0.14375551044940948, "logits/rejected": 0.6537873148918152, "logps/chosen": -53.47944259643555, "logps/rejected": -81.25194549560547, "loss": 0.4828, "rewards/accuracies": 1.0, "rewards/chosen": 0.019211266189813614, "rewards/margins": 0.5275158882141113, "rewards/rejected": -0.5083046555519104, "step": 11}
12
+ {"epoch": 0.13714285714285715, "grad_norm": 3.5064291954040527, "learning_rate": 4.935806850983034e-06, "logits/chosen": -0.02809108793735504, "logits/rejected": 1.3847907781600952, "logps/chosen": -54.27452850341797, "logps/rejected": -84.8036117553711, "loss": 0.3669, "rewards/accuracies": 1.0, "rewards/chosen": 0.038996659219264984, "rewards/margins": 0.9113224744796753, "rewards/rejected": -0.8723257184028625, "step": 12}
13
+ {"epoch": 0.14857142857142858, "grad_norm": 4.0220561027526855, "learning_rate": 4.912761632854834e-06, "logits/chosen": -0.40826213359832764, "logits/rejected": 1.0781131982803345, "logps/chosen": -80.10173797607422, "logps/rejected": -64.88600158691406, "loss": 0.4242, "rewards/accuracies": 1.0, "rewards/chosen": 0.028980137780308723, "rewards/margins": 0.7560938000679016, "rewards/rejected": -0.727113664150238, "step": 13}
14
+ {"epoch": 0.16, "grad_norm": 3.641127347946167, "learning_rate": 4.8862601569288885e-06, "logits/chosen": -0.3284621238708496, "logits/rejected": 0.6769169569015503, "logps/chosen": -126.9131088256836, "logps/rejected": -108.0735855102539, "loss": 0.378, "rewards/accuracies": 1.0, "rewards/chosen": 0.10002796351909637, "rewards/margins": 0.9067593812942505, "rewards/rejected": -0.8067314028739929, "step": 14}
15
+ {"epoch": 0.17142857142857143, "grad_norm": 3.1787471771240234, "learning_rate": 4.8563403863141825e-06, "logits/chosen": -0.23578333854675293, "logits/rejected": 0.8872382044792175, "logps/chosen": -77.02982330322266, "logps/rejected": -91.4344482421875, "loss": 0.3247, "rewards/accuracies": 1.0, "rewards/chosen": -0.0036322600208222866, "rewards/margins": 1.1259247064590454, "rewards/rejected": -1.1295570135116577, "step": 15}
16
+ {"epoch": 0.18285714285714286, "grad_norm": 3.3664069175720215, "learning_rate": 4.823045180793914e-06, "logits/chosen": -0.33357855677604675, "logits/rejected": 0.9027751088142395, "logps/chosen": -57.791385650634766, "logps/rejected": -71.88220977783203, "loss": 0.3925, "rewards/accuracies": 1.0, "rewards/chosen": 0.03762559965252876, "rewards/margins": 0.8615567684173584, "rewards/rejected": -0.823931097984314, "step": 16}
17
+ {"epoch": 0.19428571428571428, "grad_norm": 2.321681261062622, "learning_rate": 4.786422235429269e-06, "logits/chosen": -0.2371266484260559, "logits/rejected": 0.4381519556045532, "logps/chosen": -45.621620178222656, "logps/rejected": -89.46638488769531, "loss": 0.3503, "rewards/accuracies": 1.0, "rewards/chosen": 0.028645562008023262, "rewards/margins": 1.0791183710098267, "rewards/rejected": -1.0504727363586426, "step": 17}
18
+ {"epoch": 0.2057142857142857, "grad_norm": 2.6169960498809814, "learning_rate": 4.746524012236706e-06, "logits/chosen": -0.1888342797756195, "logits/rejected": 0.44934579730033875, "logps/chosen": -69.54957580566406, "logps/rejected": -59.541568756103516, "loss": 0.4125, "rewards/accuracies": 1.0, "rewards/chosen": 0.0358089953660965, "rewards/margins": 0.8032007813453674, "rewards/rejected": -0.7673917412757874, "step": 18}
19
+ {"epoch": 0.21714285714285714, "grad_norm": 2.923261880874634, "learning_rate": 4.703407665036622e-06, "logits/chosen": -0.20129157602787018, "logits/rejected": 0.6290000677108765, "logps/chosen": -56.686153411865234, "logps/rejected": -87.55162048339844, "loss": 0.264, "rewards/accuracies": 1.0, "rewards/chosen": 0.054906971752643585, "rewards/margins": 1.5454007387161255, "rewards/rejected": -1.4904940128326416, "step": 19}
20
+ {"epoch": 0.22857142857142856, "grad_norm": 2.864265203475952, "learning_rate": 4.657134957581057e-06, "logits/chosen": -0.3821311295032501, "logits/rejected": 0.48754024505615234, "logps/chosen": -62.24723815917969, "logps/rejected": -60.93783950805664, "loss": 0.3685, "rewards/accuracies": 1.0, "rewards/chosen": 0.06970775872468948, "rewards/margins": 1.0107057094573975, "rewards/rejected": -0.9409979581832886, "step": 20}
21
+ {"epoch": 0.24, "grad_norm": 1.9049395322799683, "learning_rate": 4.607772175077712e-06, "logits/chosen": -0.5025634765625, "logits/rejected": 0.4401867389678955, "logps/chosen": -57.89384460449219, "logps/rejected": -79.51171112060547, "loss": 0.3142, "rewards/accuracies": 1.0, "rewards/chosen": 0.049478232860565186, "rewards/margins": 1.3050354719161987, "rewards/rejected": -1.2555571794509888, "step": 21}
22
+ {"epoch": 0.25142857142857145, "grad_norm": 2.7351036071777344, "learning_rate": 4.555390029237026e-06, "logits/chosen": -0.36178550124168396, "logits/rejected": 0.8178424835205078, "logps/chosen": -65.52536010742188, "logps/rejected": -100.3760986328125, "loss": 0.2818, "rewards/accuracies": 0.9375, "rewards/chosen": -0.06696957349777222, "rewards/margins": 1.5236375331878662, "rewards/rejected": -1.5906071662902832, "step": 22}
23
+ {"epoch": 0.25142857142857145, "eval_logits/chosen": -0.36531969904899597, "eval_logits/rejected": 0.3482947051525116, "eval_logps/chosen": -87.77478790283203, "eval_logps/rejected": -92.11418914794922, "eval_loss": 0.30896151065826416, "eval_rewards/accuracies": 0.9800000190734863, "eval_rewards/chosen": -0.20244216918945312, "eval_rewards/margins": 1.3565798997879028, "eval_rewards/rejected": -1.559022068977356, "eval_runtime": 209.0014, "eval_samples_per_second": 0.957, "eval_steps_per_second": 0.957, "step": 22}
24
+ {"epoch": 0.26285714285714284, "grad_norm": 2.936436653137207, "learning_rate": 4.5000635569783365e-06, "logits/chosen": -0.278434157371521, "logits/rejected": 0.1438252478837967, "logps/chosen": -70.02806091308594, "logps/rejected": -57.32536697387695, "loss": 0.3441, "rewards/accuracies": 1.0, "rewards/chosen": 0.005648649297654629, "rewards/margins": 1.069925308227539, "rewards/rejected": -1.0642765760421753, "step": 23}
25
+ {"epoch": 0.2742857142857143, "grad_norm": 1.480675458908081, "learning_rate": 4.4418720129402145e-06, "logits/chosen": -0.6613065004348755, "logits/rejected": 0.20875723659992218, "logps/chosen": -43.0631217956543, "logps/rejected": -113.96063995361328, "loss": 0.2264, "rewards/accuracies": 1.0, "rewards/chosen": 0.007623173296451569, "rewards/margins": 1.854811191558838, "rewards/rejected": -1.8471879959106445, "step": 24}
26
+ {"epoch": 0.2857142857142857, "grad_norm": 2.0406107902526855, "learning_rate": 4.3808987559489536e-06, "logits/chosen": -0.4824203848838806, "logits/rejected": 0.370841383934021, "logps/chosen": -39.89043426513672, "logps/rejected": -89.99382781982422, "loss": 0.2224, "rewards/accuracies": 1.0, "rewards/chosen": 0.0602618083357811, "rewards/margins": 1.6918809413909912, "rewards/rejected": -1.6316192150115967, "step": 25}
27
+ {"epoch": 0.29714285714285715, "grad_norm": 2.2385094165802, "learning_rate": 4.317231129607859e-06, "logits/chosen": -0.5961613655090332, "logits/rejected": 0.14968276023864746, "logps/chosen": -76.45050048828125, "logps/rejected": -99.48614501953125, "loss": 0.2123, "rewards/accuracies": 1.0, "rewards/chosen": 0.07128332555294037, "rewards/margins": 1.763782024383545, "rewards/rejected": -1.6924986839294434, "step": 26}
28
+ {"epoch": 0.30857142857142855, "grad_norm": 1.6301268339157104, "learning_rate": 4.2509603371783776e-06, "logits/chosen": -0.3383774161338806, "logits/rejected": 0.15638643503189087, "logps/chosen": -58.246971130371094, "logps/rejected": -79.45714569091797, "loss": 0.2009, "rewards/accuracies": 1.0, "rewards/chosen": -0.04440131038427353, "rewards/margins": 1.9561799764633179, "rewards/rejected": -2.0005815029144287, "step": 27}
29
+ {"epoch": 0.32, "grad_norm": 2.236377716064453, "learning_rate": 4.1821813109322975e-06, "logits/chosen": -0.647399365901947, "logits/rejected": 0.22453227639198303, "logps/chosen": -88.88107299804688, "logps/rejected": -96.83210754394531, "loss": 0.2263, "rewards/accuracies": 1.0, "rewards/chosen": 0.040186457335948944, "rewards/margins": 1.824659824371338, "rewards/rejected": -1.7844732999801636, "step": 28}
30
+ {"epoch": 0.3314285714285714, "grad_norm": 2.0542852878570557, "learning_rate": 4.110992576162193e-06, "logits/chosen": -0.5227777361869812, "logits/rejected": -0.2961636781692505, "logps/chosen": -78.49622344970703, "logps/rejected": -78.24589538574219, "loss": 0.2121, "rewards/accuracies": 1.0, "rewards/chosen": 0.10791393369436264, "rewards/margins": 1.7918672561645508, "rewards/rejected": -1.6839532852172852, "step": 29}
31
+ {"epoch": 0.34285714285714286, "grad_norm": 1.9906846284866333, "learning_rate": 4.037496110044885e-06, "logits/chosen": -0.44146519899368286, "logits/rejected": 0.24826864898204803, "logps/chosen": -89.6866683959961, "logps/rejected": -122.11793518066406, "loss": 0.1621, "rewards/accuracies": 1.0, "rewards/chosen": -0.04959860444068909, "rewards/margins": 2.5837507247924805, "rewards/rejected": -2.6333494186401367, "step": 30}
32
+ {"epoch": 0.35428571428571426, "grad_norm": 2.3201839923858643, "learning_rate": 3.961797195560118e-06, "logits/chosen": -0.37571054697036743, "logits/rejected": -0.12684349715709686, "logps/chosen": -62.36381530761719, "logps/rejected": -68.8594741821289, "loss": 0.2406, "rewards/accuracies": 1.0, "rewards/chosen": 0.013891173526644707, "rewards/margins": 1.7061822414398193, "rewards/rejected": -1.6922911405563354, "step": 31}
33
+ {"epoch": 0.3657142857142857, "grad_norm": 1.7459288835525513, "learning_rate": 3.884004270673711e-06, "logits/chosen": -0.4904371500015259, "logits/rejected": -0.09516231715679169, "logps/chosen": -51.67000198364258, "logps/rejected": -87.77179718017578, "loss": 0.1739, "rewards/accuracies": 1.0, "rewards/chosen": 0.05766277387738228, "rewards/margins": 2.167266845703125, "rewards/rejected": -2.1096038818359375, "step": 32}
34
+ {"epoch": 0.37714285714285717, "grad_norm": 1.9478814601898193, "learning_rate": 3.8042287730012117e-06, "logits/chosen": -0.7833026051521301, "logits/rejected": -0.14795458316802979, "logps/chosen": -49.5107307434082, "logps/rejected": -77.62210845947266, "loss": 0.1861, "rewards/accuracies": 1.0, "rewards/chosen": 0.02107466384768486, "rewards/margins": 1.9514578580856323, "rewards/rejected": -1.9303834438323975, "step": 33}
35
+ {"epoch": 0.38857142857142857, "grad_norm": 2.1133761405944824, "learning_rate": 3.7225849801745835e-06, "logits/chosen": -0.8189583420753479, "logits/rejected": -0.24318619072437286, "logps/chosen": -75.10845947265625, "logps/rejected": -111.31871032714844, "loss": 0.1489, "rewards/accuracies": 1.0, "rewards/chosen": 0.029190005734562874, "rewards/margins": 2.6350479125976562, "rewards/rejected": -2.6058578491210938, "step": 34}
36
+ {"epoch": 0.4, "grad_norm": 2.116342306137085, "learning_rate": 3.6391898461406045e-06, "logits/chosen": -0.4198293685913086, "logits/rejected": -0.3276508152484894, "logps/chosen": -63.513519287109375, "logps/rejected": -93.56440734863281, "loss": 0.2266, "rewards/accuracies": 1.0, "rewards/chosen": 0.09839610755443573, "rewards/margins": 1.798091173171997, "rewards/rejected": -1.6996949911117554, "step": 35}
37
+ {"epoch": 0.4114285714285714, "grad_norm": 1.6935662031173706, "learning_rate": 3.55416283362546e-06, "logits/chosen": -0.8055887222290039, "logits/rejected": 0.15487802028656006, "logps/chosen": -46.510643005371094, "logps/rejected": -105.87352752685547, "loss": 0.1607, "rewards/accuracies": 1.0, "rewards/chosen": 0.033490121364593506, "rewards/margins": 2.649106025695801, "rewards/rejected": -2.6156160831451416, "step": 36}
38
+ {"epoch": 0.4228571428571429, "grad_norm": 2.2720091342926025, "learning_rate": 3.4676257430055438e-06, "logits/chosen": -0.8104305267333984, "logits/rejected": 0.04826318100094795, "logps/chosen": -77.22013854980469, "logps/rejected": -98.19013977050781, "loss": 0.1415, "rewards/accuracies": 1.0, "rewards/chosen": 0.03917883336544037, "rewards/margins": 2.6867618560791016, "rewards/rejected": -2.6475830078125, "step": 37}
39
+ {"epoch": 0.4342857142857143, "grad_norm": 1.546297550201416, "learning_rate": 3.3797025378295826e-06, "logits/chosen": -0.8403704166412354, "logits/rejected": 0.052355289459228516, "logps/chosen": -56.61090087890625, "logps/rejected": -119.7930679321289, "loss": 0.1658, "rewards/accuracies": 1.0, "rewards/chosen": 0.022541070356965065, "rewards/margins": 2.8231887817382812, "rewards/rejected": -2.800647735595703, "step": 38}
40
+ {"epoch": 0.44571428571428573, "grad_norm": 2.0681819915771484, "learning_rate": 3.29051916724206e-06, "logits/chosen": -0.6301568746566772, "logits/rejected": -0.32246649265289307, "logps/chosen": -66.40396118164062, "logps/rejected": -81.09312438964844, "loss": 0.1799, "rewards/accuracies": 1.0, "rewards/chosen": 0.009487343952059746, "rewards/margins": 2.2801120281219482, "rewards/rejected": -2.2706246376037598, "step": 39}
41
+ {"epoch": 0.45714285714285713, "grad_norm": 1.4052331447601318, "learning_rate": 3.2002033855622683e-06, "logits/chosen": -0.8533369302749634, "logits/rejected": -0.4283853769302368, "logps/chosen": -47.345802307128906, "logps/rejected": -93.77117919921875, "loss": 0.1517, "rewards/accuracies": 1.0, "rewards/chosen": -0.026743369176983833, "rewards/margins": 2.6302499771118164, "rewards/rejected": -2.6569931507110596, "step": 40}
42
+ {"epoch": 0.4685714285714286, "grad_norm": 2.0809950828552246, "learning_rate": 3.1088845692774798e-06, "logits/chosen": -0.6270914077758789, "logits/rejected": -0.6155582070350647, "logps/chosen": -88.60835266113281, "logps/rejected": -67.6736831665039, "loss": 0.1825, "rewards/accuracies": 1.0, "rewards/chosen": 0.04146631807088852, "rewards/margins": 2.0336129665374756, "rewards/rejected": -1.9921468496322632, "step": 41}
43
+ {"epoch": 0.48, "grad_norm": 1.1893919706344604, "learning_rate": 3.0166935317123824e-06, "logits/chosen": -1.0347564220428467, "logits/rejected": -0.4240405261516571, "logps/chosen": -56.76289367675781, "logps/rejected": -103.66142272949219, "loss": 0.1124, "rewards/accuracies": 1.0, "rewards/chosen": -0.057413943111896515, "rewards/margins": 3.0061051845550537, "rewards/rejected": -3.06351900100708, "step": 42}
44
+ {"epoch": 0.49142857142857144, "grad_norm": 1.1706154346466064, "learning_rate": 2.9237623356402423e-06, "logits/chosen": -1.0618159770965576, "logits/rejected": -0.327092707157135, "logps/chosen": -32.207794189453125, "logps/rejected": -111.8665771484375, "loss": 0.0903, "rewards/accuracies": 1.0, "rewards/chosen": -0.027263116091489792, "rewards/margins": 3.3231871128082275, "rewards/rejected": -3.350450277328491, "step": 43}
45
+ {"epoch": 0.5028571428571429, "grad_norm": 1.079911470413208, "learning_rate": 2.8302241041042564e-06, "logits/chosen": -1.1862759590148926, "logits/rejected": -0.7669480443000793, "logps/chosen": -89.4259262084961, "logps/rejected": -127.56314086914062, "loss": 0.0967, "rewards/accuracies": 1.0, "rewards/chosen": 0.14472071826457977, "rewards/margins": 3.0603933334350586, "rewards/rejected": -2.915672540664673, "step": 44}
46
+ {"epoch": 0.5028571428571429, "eval_logits/chosen": -0.8571964502334595, "eval_logits/rejected": -0.6531373858451843, "eval_logps/chosen": -90.10453033447266, "eval_logps/rejected": -104.75491333007812, "eval_loss": 0.17935897409915924, "eval_rewards/accuracies": 0.9700000286102295, "eval_rewards/chosen": -0.4354174733161926, "eval_rewards/margins": 2.387676954269409, "eval_rewards/rejected": -2.8230948448181152, "eval_runtime": 208.3973, "eval_samples_per_second": 0.96, "eval_steps_per_second": 0.96, "step": 44}
47
+ {"epoch": 0.5142857142857142, "grad_norm": 1.5324379205703735, "learning_rate": 2.7362128297200784e-06, "logits/chosen": -0.7203244566917419, "logits/rejected": -0.5576686859130859, "logps/chosen": -65.52645874023438, "logps/rejected": -95.54450988769531, "loss": 0.1323, "rewards/accuracies": 1.0, "rewards/chosen": 0.1149684339761734, "rewards/margins": 2.6911990642547607, "rewards/rejected": -2.576230525970459, "step": 45}
48
+ {"epoch": 0.5257142857142857, "grad_norm": 1.2247161865234375, "learning_rate": 2.6418631827326857e-06, "logits/chosen": -0.9313367009162903, "logits/rejected": -0.8070792555809021, "logps/chosen": -55.876502990722656, "logps/rejected": -119.91787719726562, "loss": 0.1285, "rewards/accuracies": 1.0, "rewards/chosen": 0.06400280445814133, "rewards/margins": 2.901925802230835, "rewards/rejected": -2.837923288345337, "step": 46}
49
+ {"epoch": 0.5371428571428571, "grad_norm": 1.3425116539001465, "learning_rate": 2.547310318102548e-06, "logits/chosen": -0.9409236907958984, "logits/rejected": -0.7352248430252075, "logps/chosen": -50.5601806640625, "logps/rejected": -86.23294830322266, "loss": 0.1466, "rewards/accuracies": 1.0, "rewards/chosen": 0.09888257831335068, "rewards/margins": 2.470425844192505, "rewards/rejected": -2.3715431690216064, "step": 47}
50
+ {"epoch": 0.5485714285714286, "grad_norm": 1.4391740560531616, "learning_rate": 2.4526896818974534e-06, "logits/chosen": -0.8374643921852112, "logits/rejected": -0.47213953733444214, "logps/chosen": -50.190616607666016, "logps/rejected": -91.12651824951172, "loss": 0.1023, "rewards/accuracies": 1.0, "rewards/chosen": -0.009993518702685833, "rewards/margins": 2.796506881713867, "rewards/rejected": -2.8065006732940674, "step": 48}
51
+ {"epoch": 0.56, "grad_norm": 1.5294134616851807, "learning_rate": 2.358136817267315e-06, "logits/chosen": -0.8648539185523987, "logits/rejected": -0.736384391784668, "logps/chosen": -72.85952758789062, "logps/rejected": -83.08409881591797, "loss": 0.1516, "rewards/accuracies": 1.0, "rewards/chosen": 0.09306713193655014, "rewards/margins": 2.5247979164123535, "rewards/rejected": -2.4317305088043213, "step": 49}
52
+ {"epoch": 0.5714285714285714, "grad_norm": 1.6909253597259521, "learning_rate": 2.263787170279922e-06, "logits/chosen": -1.3599584102630615, "logits/rejected": -1.2676033973693848, "logps/chosen": -78.65673065185547, "logps/rejected": -69.09491729736328, "loss": 0.1557, "rewards/accuracies": 1.0, "rewards/chosen": 0.00439932756125927, "rewards/margins": 2.1822092533111572, "rewards/rejected": -2.177809953689575, "step": 50}
53
+ {"epoch": 0.5828571428571429, "grad_norm": 1.3136837482452393, "learning_rate": 2.169775895895745e-06, "logits/chosen": -0.7750363349914551, "logits/rejected": -0.7582042217254639, "logps/chosen": -48.27521514892578, "logps/rejected": -105.779541015625, "loss": 0.0944, "rewards/accuracies": 1.0, "rewards/chosen": 0.060845933854579926, "rewards/margins": 3.2103078365325928, "rewards/rejected": -3.1494617462158203, "step": 51}
54
+ {"epoch": 0.5942857142857143, "grad_norm": 1.304816722869873, "learning_rate": 2.0762376643597586e-06, "logits/chosen": -0.7206559777259827, "logits/rejected": -0.7368943691253662, "logps/chosen": -49.27516174316406, "logps/rejected": -99.28387451171875, "loss": 0.1227, "rewards/accuracies": 1.0, "rewards/chosen": 0.08159955590963364, "rewards/margins": 2.943441390991211, "rewards/rejected": -2.861841917037964, "step": 52}
55
+ {"epoch": 0.6057142857142858, "grad_norm": 1.1686677932739258, "learning_rate": 1.9833064682876175e-06, "logits/chosen": -0.7927972674369812, "logits/rejected": -0.8789339065551758, "logps/chosen": -62.97304916381836, "logps/rejected": -93.07855224609375, "loss": 0.097, "rewards/accuracies": 1.0, "rewards/chosen": 0.10683320462703705, "rewards/margins": 2.952019453048706, "rewards/rejected": -2.8451859951019287, "step": 53}
56
+ {"epoch": 0.6171428571428571, "grad_norm": 0.7459912300109863, "learning_rate": 1.8911154307225204e-06, "logits/chosen": -0.7670217752456665, "logits/rejected": -0.7017982006072998, "logps/chosen": -31.30267333984375, "logps/rejected": -110.78553771972656, "loss": 0.0593, "rewards/accuracies": 1.0, "rewards/chosen": 0.003862532787024975, "rewards/margins": 3.5174167156219482, "rewards/rejected": -3.513554096221924, "step": 54}
57
+ {"epoch": 0.6285714285714286, "grad_norm": 1.5418952703475952, "learning_rate": 1.7997966144377328e-06, "logits/chosen": -0.986474871635437, "logits/rejected": -1.1061036586761475, "logps/chosen": -47.49861526489258, "logps/rejected": -67.53656005859375, "loss": 0.1543, "rewards/accuracies": 1.0, "rewards/chosen": -0.04688534885644913, "rewards/margins": 2.227695941925049, "rewards/rejected": -2.27458119392395, "step": 55}
58
+ {"epoch": 0.64, "grad_norm": 1.0748093128204346, "learning_rate": 1.7094808327579401e-06, "logits/chosen": -1.324556589126587, "logits/rejected": -0.8223966360092163, "logps/chosen": -36.40914535522461, "logps/rejected": -105.08839416503906, "loss": 0.084, "rewards/accuracies": 1.0, "rewards/chosen": -0.07963553071022034, "rewards/margins": 3.377859354019165, "rewards/rejected": -3.4574952125549316, "step": 56}
59
+ {"epoch": 0.6514285714285715, "grad_norm": 0.9280484318733215, "learning_rate": 1.6202974621704176e-06, "logits/chosen": -1.450647234916687, "logits/rejected": -0.8040248155593872, "logps/chosen": -68.76046752929688, "logps/rejected": -125.3299331665039, "loss": 0.0635, "rewards/accuracies": 1.0, "rewards/chosen": 0.06499414145946503, "rewards/margins": 3.9410018920898438, "rewards/rejected": -3.876007318496704, "step": 57}
60
+ {"epoch": 0.6628571428571428, "grad_norm": 0.8896822333335876, "learning_rate": 1.5323742569944573e-06, "logits/chosen": -1.0071394443511963, "logits/rejected": -1.0022106170654297, "logps/chosen": -45.09584426879883, "logps/rejected": -109.64781951904297, "loss": 0.0802, "rewards/accuracies": 1.0, "rewards/chosen": 0.034890901297330856, "rewards/margins": 3.5162737369537354, "rewards/rejected": -3.4813833236694336, "step": 58}
61
+ {"epoch": 0.6742857142857143, "grad_norm": 0.7682043313980103, "learning_rate": 1.44583716637454e-06, "logits/chosen": -1.0028694868087769, "logits/rejected": -0.813642144203186, "logps/chosen": -66.2764663696289, "logps/rejected": -112.77369689941406, "loss": 0.0576, "rewards/accuracies": 1.0, "rewards/chosen": -0.0501595139503479, "rewards/margins": 3.7721147537231445, "rewards/rejected": -3.822274684906006, "step": 59}
62
+ {"epoch": 0.6857142857142857, "grad_norm": 1.0216327905654907, "learning_rate": 1.3608101538593965e-06, "logits/chosen": -1.1250649690628052, "logits/rejected": -0.9627130627632141, "logps/chosen": -42.440757751464844, "logps/rejected": -100.12843322753906, "loss": 0.0804, "rewards/accuracies": 1.0, "rewards/chosen": 0.11411059647798538, "rewards/margins": 3.393651247024536, "rewards/rejected": -3.2795403003692627, "step": 60}
63
+ {"epoch": 0.6971428571428572, "grad_norm": 0.7271348834037781, "learning_rate": 1.277415019825417e-06, "logits/chosen": -0.7807080745697021, "logits/rejected": -0.7796292304992676, "logps/chosen": -33.5434455871582, "logps/rejected": -112.23175048828125, "loss": 0.0711, "rewards/accuracies": 1.0, "rewards/chosen": -0.06058162823319435, "rewards/margins": 3.8745694160461426, "rewards/rejected": -3.9351511001586914, "step": 61}
64
+ {"epoch": 0.7085714285714285, "grad_norm": 1.7274105548858643, "learning_rate": 1.195771226998789e-06, "logits/chosen": -0.9823087453842163, "logits/rejected": -1.2148367166519165, "logps/chosen": -72.55377960205078, "logps/rejected": -75.32920837402344, "loss": 0.1183, "rewards/accuracies": 1.0, "rewards/chosen": -0.12965497374534607, "rewards/margins": 2.7459590435028076, "rewards/rejected": -2.8756141662597656, "step": 62}
65
+ {"epoch": 0.72, "grad_norm": 0.9623571038246155, "learning_rate": 1.1159957293262888e-06, "logits/chosen": -1.0808844566345215, "logits/rejected": -0.8635554909706116, "logps/chosen": -49.637996673583984, "logps/rejected": -116.99398803710938, "loss": 0.09, "rewards/accuracies": 1.0, "rewards/chosen": 0.02851293236017227, "rewards/margins": 3.4344334602355957, "rewards/rejected": -3.4059205055236816, "step": 63}
66
+ {"epoch": 0.7314285714285714, "grad_norm": 1.0066514015197754, "learning_rate": 1.0382028044398823e-06, "logits/chosen": -1.197101354598999, "logits/rejected": -1.1306017637252808, "logps/chosen": -50.98615264892578, "logps/rejected": -120.8044662475586, "loss": 0.0899, "rewards/accuracies": 1.0, "rewards/chosen": -0.035914015024900436, "rewards/margins": 3.1908507347106934, "rewards/rejected": -3.2267649173736572, "step": 64}
67
+ {"epoch": 0.7428571428571429, "grad_norm": 1.1005553007125854, "learning_rate": 9.625038899551162e-07, "logits/chosen": -1.22350013256073, "logits/rejected": -1.1208860874176025, "logps/chosen": -66.32962036132812, "logps/rejected": -103.34649658203125, "loss": 0.0709, "rewards/accuracies": 1.0, "rewards/chosen": 0.18690410256385803, "rewards/margins": 3.4826159477233887, "rewards/rejected": -3.2957119941711426, "step": 65}
68
+ {"epoch": 0.7542857142857143, "grad_norm": 0.954483687877655, "learning_rate": 8.890074238378074e-07, "logits/chosen": -0.9665268659591675, "logits/rejected": -0.8029574751853943, "logps/chosen": -43.259857177734375, "logps/rejected": -104.5782241821289, "loss": 0.0993, "rewards/accuracies": 1.0, "rewards/chosen": -0.044777870178222656, "rewards/margins": 3.1982903480529785, "rewards/rejected": -3.243067979812622, "step": 66}
69
+ {"epoch": 0.7542857142857143, "eval_logits/chosen": -1.1089446544647217, "eval_logits/rejected": -1.1692878007888794, "eval_logps/chosen": -91.48172760009766, "eval_logps/rejected": -110.86624145507812, "eval_loss": 0.14132851362228394, "eval_rewards/accuracies": 0.9700000286102295, "eval_rewards/chosen": -0.573137104511261, "eval_rewards/margins": 2.8610901832580566, "eval_rewards/rejected": -3.4342269897460938, "eval_runtime": 208.8549, "eval_samples_per_second": 0.958, "eval_steps_per_second": 0.958, "step": 66}
70
+ {"epoch": 0.7657142857142857, "grad_norm": 0.9773061871528625, "learning_rate": 8.178186890677029e-07, "logits/chosen": -1.02699875831604, "logits/rejected": -1.1385068893432617, "logps/chosen": -80.82888793945312, "logps/rejected": -100.25572967529297, "loss": 0.072, "rewards/accuracies": 1.0, "rewards/chosen": 0.0796530619263649, "rewards/margins": 3.1960816383361816, "rewards/rejected": -3.116428852081299, "step": 67}
71
+ {"epoch": 0.7771428571428571, "grad_norm": 1.2940922975540161, "learning_rate": 7.490396628216237e-07, "logits/chosen": -1.2090729475021362, "logits/rejected": -1.2437564134597778, "logps/chosen": -87.85923767089844, "logps/rejected": -120.87287902832031, "loss": 0.1183, "rewards/accuracies": 1.0, "rewards/chosen": 0.018895722925662994, "rewards/margins": 2.969498634338379, "rewards/rejected": -2.9506030082702637, "step": 68}
72
+ {"epoch": 0.7885714285714286, "grad_norm": 0.7793561220169067, "learning_rate": 6.827688703921407e-07, "logits/chosen": -1.1516605615615845, "logits/rejected": -1.295521855354309, "logps/chosen": -52.94973373413086, "logps/rejected": -84.64179229736328, "loss": 0.067, "rewards/accuracies": 1.0, "rewards/chosen": 0.18537920713424683, "rewards/margins": 3.4953463077545166, "rewards/rejected": -3.309967041015625, "step": 69}
73
+ {"epoch": 0.8, "grad_norm": 1.4742248058319092, "learning_rate": 6.191012440510469e-07, "logits/chosen": -1.3784356117248535, "logits/rejected": -1.3366318941116333, "logps/chosen": -57.7204475402832, "logps/rejected": -90.2862548828125, "loss": 0.1197, "rewards/accuracies": 1.0, "rewards/chosen": -0.044269490987062454, "rewards/margins": 2.759215831756592, "rewards/rejected": -2.80348539352417, "step": 70}
74
+ {"epoch": 0.8114285714285714, "grad_norm": 0.7249897718429565, "learning_rate": 5.581279870597866e-07, "logits/chosen": -1.1907292604446411, "logits/rejected": -0.6756631731987, "logps/chosen": -32.33828353881836, "logps/rejected": -125.02144622802734, "loss": 0.0525, "rewards/accuracies": 1.0, "rewards/chosen": -0.06472505629062653, "rewards/margins": 4.0654168128967285, "rewards/rejected": -4.130141258239746, "step": 71}
75
+ {"epoch": 0.8228571428571428, "grad_norm": 1.0847841501235962, "learning_rate": 4.999364430216639e-07, "logits/chosen": -1.237339735031128, "logits/rejected": -1.5806419849395752, "logps/chosen": -52.456146240234375, "logps/rejected": -94.31544494628906, "loss": 0.0992, "rewards/accuracies": 1.0, "rewards/chosen": 0.10363951325416565, "rewards/margins": 2.9890761375427246, "rewards/rejected": -2.885436534881592, "step": 72}
76
+ {"epoch": 0.8342857142857143, "grad_norm": 1.278956651687622, "learning_rate": 4.4460997076297504e-07, "logits/chosen": -1.0774935483932495, "logits/rejected": -1.4760003089904785, "logps/chosen": -43.07012939453125, "logps/rejected": -74.25629425048828, "loss": 0.1131, "rewards/accuracies": 1.0, "rewards/chosen": 0.06534770131111145, "rewards/margins": 2.8206787109375, "rewards/rejected": -2.75533127784729, "step": 73}
77
+ {"epoch": 0.8457142857142858, "grad_norm": 0.7833404541015625, "learning_rate": 3.922278249222894e-07, "logits/chosen": -1.1311602592468262, "logits/rejected": -1.0242271423339844, "logps/chosen": -53.541568756103516, "logps/rejected": -105.48152923583984, "loss": 0.0774, "rewards/accuracies": 1.0, "rewards/chosen": 0.04792798310518265, "rewards/margins": 3.678433418273926, "rewards/rejected": -3.6305058002471924, "step": 74}
78
+ {"epoch": 0.8571428571428571, "grad_norm": 1.03605318069458, "learning_rate": 3.4286504241894283e-07, "logits/chosen": -0.9688073992729187, "logits/rejected": -1.2700920104980469, "logps/chosen": -38.00965118408203, "logps/rejected": -92.08466339111328, "loss": 0.1049, "rewards/accuracies": 1.0, "rewards/chosen": -0.01876715011894703, "rewards/margins": 3.16585636138916, "rewards/rejected": -3.1846237182617188, "step": 75}
79
+ {"epoch": 0.8685714285714285, "grad_norm": 1.319770336151123, "learning_rate": 2.965923349633779e-07, "logits/chosen": -1.3658266067504883, "logits/rejected": -1.3608825206756592, "logps/chosen": -49.00103759765625, "logps/rejected": -117.49503326416016, "loss": 0.0818, "rewards/accuracies": 1.0, "rewards/chosen": -0.09428122639656067, "rewards/margins": 3.61112642288208, "rewards/rejected": -3.7054080963134766, "step": 76}
80
+ {"epoch": 0.88, "grad_norm": 0.9297468662261963, "learning_rate": 2.53475987763295e-07, "logits/chosen": -1.0338634252548218, "logits/rejected": -1.1930313110351562, "logps/chosen": -67.0118179321289, "logps/rejected": -106.61903381347656, "loss": 0.0727, "rewards/accuracies": 1.0, "rewards/chosen": -0.13288229703903198, "rewards/margins": 3.487334728240967, "rewards/rejected": -3.6202168464660645, "step": 77}
81
+ {"epoch": 0.8914285714285715, "grad_norm": 1.1066629886627197, "learning_rate": 2.135777645707318e-07, "logits/chosen": -1.384450078010559, "logits/rejected": -1.3552913665771484, "logps/chosen": -52.43301010131836, "logps/rejected": -101.87602996826172, "loss": 0.0989, "rewards/accuracies": 1.0, "rewards/chosen": 0.009377628564834595, "rewards/margins": 3.135222911834717, "rewards/rejected": -3.125845432281494, "step": 78}
82
+ {"epoch": 0.9028571428571428, "grad_norm": 1.0631781816482544, "learning_rate": 1.7695481920608716e-07, "logits/chosen": -1.1844675540924072, "logits/rejected": -1.0223643779754639, "logps/chosen": -45.87510299682617, "logps/rejected": -102.84295654296875, "loss": 0.0862, "rewards/accuracies": 1.0, "rewards/chosen": -0.05180816724896431, "rewards/margins": 3.2761740684509277, "rewards/rejected": -3.3279824256896973, "step": 79}
83
+ {"epoch": 0.9142857142857143, "grad_norm": 1.2742042541503906, "learning_rate": 1.4365961368581844e-07, "logits/chosen": -1.2797547578811646, "logits/rejected": -1.6902124881744385, "logps/chosen": -79.47929382324219, "logps/rejected": -78.93382263183594, "loss": 0.1025, "rewards/accuracies": 1.0, "rewards/chosen": -0.0567280538380146, "rewards/margins": 2.9206228256225586, "rewards/rejected": -2.977350950241089, "step": 80}
84
+ {"epoch": 0.9257142857142857, "grad_norm": 0.8278792500495911, "learning_rate": 1.137398430711123e-07, "logits/chosen": -1.119363784790039, "logits/rejected": -0.9186141490936279, "logps/chosen": -29.899991989135742, "logps/rejected": -105.7519302368164, "loss": 0.0648, "rewards/accuracies": 1.0, "rewards/chosen": 0.031892240047454834, "rewards/margins": 3.5144004821777344, "rewards/rejected": -3.4825081825256348, "step": 81}
85
+ {"epoch": 0.9371428571428572, "grad_norm": 1.0955795049667358, "learning_rate": 8.723836714516681e-08, "logits/chosen": -1.2281020879745483, "logits/rejected": -1.3817219734191895, "logps/chosen": -73.53196716308594, "logps/rejected": -103.11698913574219, "loss": 0.0811, "rewards/accuracies": 1.0, "rewards/chosen": -0.06516408920288086, "rewards/margins": 3.2024097442626953, "rewards/rejected": -3.267573833465576, "step": 82}
86
+ {"epoch": 0.9485714285714286, "grad_norm": 0.6436601877212524, "learning_rate": 6.419314901696671e-08, "logits/chosen": -1.2053653001785278, "logits/rejected": -1.208804965019226, "logps/chosen": -28.06381607055664, "logps/rejected": -100.99942016601562, "loss": 0.0586, "rewards/accuracies": 1.0, "rewards/chosen": -0.027196241542696953, "rewards/margins": 3.633328437805176, "rewards/rejected": -3.660524845123291, "step": 83}
87
+ {"epoch": 0.96, "grad_norm": 0.9888738393783569, "learning_rate": 4.4637200739493514e-08, "logits/chosen": -1.231987714767456, "logits/rejected": -1.143172025680542, "logps/chosen": -57.63927459716797, "logps/rejected": -96.07897186279297, "loss": 0.1077, "rewards/accuracies": 1.0, "rewards/chosen": -0.05573497712612152, "rewards/margins": 3.1897521018981934, "rewards/rejected": -3.2454872131347656, "step": 84}
88
+ {"epoch": 0.9714285714285714, "grad_norm": 1.0415937900543213, "learning_rate": 2.8598536020278678e-08, "logits/chosen": -1.221508264541626, "logits/rejected": -1.4119690656661987, "logps/chosen": -48.45242691040039, "logps/rejected": -84.4826431274414, "loss": 0.0827, "rewards/accuracies": 1.0, "rewards/chosen": 0.04423363134264946, "rewards/margins": 3.218625545501709, "rewards/rejected": -3.174391984939575, "step": 85}
89
+ {"epoch": 0.9828571428571429, "grad_norm": 1.0360701084136963, "learning_rate": 1.6100130092037704e-08, "logits/chosen": -1.3318215608596802, "logits/rejected": -1.6143568754196167, "logps/chosen": -45.959354400634766, "logps/rejected": -79.45930480957031, "loss": 0.0892, "rewards/accuracies": 1.0, "rewards/chosen": -0.08850360661745071, "rewards/margins": 2.9804043769836426, "rewards/rejected": -3.068908214569092, "step": 86}
90
+ {"epoch": 0.9942857142857143, "grad_norm": 0.7161802053451538, "learning_rate": 7.159886800869875e-09, "logits/chosen": -1.1106700897216797, "logits/rejected": -0.9769763946533203, "logps/chosen": -85.0906982421875, "logps/rejected": -132.0802459716797, "loss": 0.0524, "rewards/accuracies": 1.0, "rewards/chosen": -0.0784958153963089, "rewards/margins": 4.037193298339844, "rewards/rejected": -4.115689277648926, "step": 87}
91
+ {"epoch": 1.0, "grad_norm": 2.9429450035095215, "learning_rate": 1.7906129591713228e-09, "logits/chosen": -1.2418022155761719, "logits/rejected": -0.8798779249191284, "logps/chosen": -90.4301986694336, "logps/rejected": -115.04806518554688, "loss": 0.0987, "rewards/accuracies": 1.0, "rewards/chosen": -0.08904826641082764, "rewards/margins": 3.531545639038086, "rewards/rejected": -3.620594024658203, "step": 88}
92
+ {"epoch": 1.0, "eval_logits/chosen": -1.1477130651474, "eval_logits/rejected": -1.244410514831543, "eval_logps/chosen": -91.70614624023438, "eval_logps/rejected": -111.82247161865234, "eval_loss": 0.1359921395778656, "eval_rewards/accuracies": 0.9700000286102295, "eval_rewards/chosen": -0.5955771207809448, "eval_rewards/margins": 2.9342737197875977, "eval_rewards/rejected": -3.529850959777832, "eval_runtime": 209.3361, "eval_samples_per_second": 0.955, "eval_steps_per_second": 0.955, "step": 88}
93
+ {"epoch": 1.0, "step": 88, "total_flos": 0.0, "train_loss": 0.2132695221172815, "train_runtime": 4416.7921, "train_samples_per_second": 0.317, "train_steps_per_second": 0.02}
training/trainer_state.json ADDED
@@ -0,0 +1,1423 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "max_steps": 88,
3
+ "save_steps": 22,
4
+ "is_world_process_zero": true,
5
+ "train_batch_size": 1,
6
+ "stateful_callbacks": {
7
+ "TrainerControl": {
8
+ "args": {
9
+ "should_epoch_stop": false,
10
+ "should_evaluate": false,
11
+ "should_log": false,
12
+ "should_save": true,
13
+ "should_training_stop": true
14
+ },
15
+ "attributes": {}
16
+ }
17
+ },
18
+ "is_hyper_param_search": false,
19
+ "num_input_tokens_seen": 0,
20
+ "log_history": [
21
+ {
22
+ "epoch": 0.011428571428571429,
23
+ "grad_norm": 5.672101974487305,
24
+ "learning_rate": 0.0,
25
+ "logits/chosen": -0.003827691078186035,
26
+ "logits/rejected": 1.6622543334960938,
27
+ "logps/chosen": -53.823280334472656,
28
+ "logps/rejected": -83.19792175292969,
29
+ "loss": 0.6931,
30
+ "rewards/accuracies": 0.0,
31
+ "rewards/chosen": 0.0,
32
+ "rewards/margins": 0.0,
33
+ "rewards/rejected": 0.0,
34
+ "step": 1
35
+ },
36
+ {
37
+ "epoch": 0.022857142857142857,
38
+ "grad_norm": 5.676645755767822,
39
+ "learning_rate": 1.0000000000000002e-06,
40
+ "logits/chosen": -0.23317879438400269,
41
+ "logits/rejected": 1.487736701965332,
42
+ "logps/chosen": -105.3038101196289,
43
+ "logps/rejected": -72.62786102294922,
44
+ "loss": 0.6931,
45
+ "rewards/accuracies": 0.0,
46
+ "rewards/chosen": 0.0,
47
+ "rewards/margins": 0.0,
48
+ "rewards/rejected": 0.0,
49
+ "step": 2
50
+ },
51
+ {
52
+ "epoch": 0.03428571428571429,
53
+ "grad_norm": 5.494569778442383,
54
+ "learning_rate": 2.0000000000000003e-06,
55
+ "logits/chosen": -0.34497007727622986,
56
+ "logits/rejected": 1.3572413921356201,
57
+ "logps/chosen": -78.18315124511719,
58
+ "logps/rejected": -92.42572021484375,
59
+ "loss": 0.6925,
60
+ "rewards/accuracies": 0.5,
61
+ "rewards/chosen": -0.010104288347065449,
62
+ "rewards/margins": 0.001475572120398283,
63
+ "rewards/rejected": -0.011579860001802444,
64
+ "step": 3
65
+ },
66
+ {
67
+ "epoch": 0.045714285714285714,
68
+ "grad_norm": 5.875666618347168,
69
+ "learning_rate": 3e-06,
70
+ "logits/chosen": 0.0768582671880722,
71
+ "logits/rejected": 1.793702244758606,
72
+ "logps/chosen": -49.45244598388672,
73
+ "logps/rejected": -70.34400939941406,
74
+ "loss": 0.6824,
75
+ "rewards/accuracies": 0.75,
76
+ "rewards/chosen": -0.006157493684440851,
77
+ "rewards/margins": 0.02201489359140396,
78
+ "rewards/rejected": -0.028172386810183525,
79
+ "step": 4
80
+ },
81
+ {
82
+ "epoch": 0.05714285714285714,
83
+ "grad_norm": 4.4969987869262695,
84
+ "learning_rate": 4.000000000000001e-06,
85
+ "logits/chosen": 0.29756978154182434,
86
+ "logits/rejected": 1.5599043369293213,
87
+ "logps/chosen": -38.330902099609375,
88
+ "logps/rejected": -58.7880859375,
89
+ "loss": 0.6602,
90
+ "rewards/accuracies": 1.0,
91
+ "rewards/chosen": 0.0054547907784581184,
92
+ "rewards/margins": 0.06765428930521011,
93
+ "rewards/rejected": -0.06219949945807457,
94
+ "step": 5
95
+ },
96
+ {
97
+ "epoch": 0.06857142857142857,
98
+ "grad_norm": 5.193802356719971,
99
+ "learning_rate": 5e-06,
100
+ "logits/chosen": -0.097133569419384,
101
+ "logits/rejected": 1.5903254747390747,
102
+ "logps/chosen": -71.06304168701172,
103
+ "logps/rejected": -69.80386352539062,
104
+ "loss": 0.6118,
105
+ "rewards/accuracies": 0.9375,
106
+ "rewards/chosen": 0.02022118680179119,
107
+ "rewards/margins": 0.1755855232477188,
108
+ "rewards/rejected": -0.15536434948444366,
109
+ "step": 6
110
+ },
111
+ {
112
+ "epoch": 0.08,
113
+ "grad_norm": 4.568131446838379,
114
+ "learning_rate": 4.998209387040829e-06,
115
+ "logits/chosen": 0.22878801822662354,
116
+ "logits/rejected": 1.2406954765319824,
117
+ "logps/chosen": -65.77464294433594,
118
+ "logps/rejected": -70.03345489501953,
119
+ "loss": 0.5809,
120
+ "rewards/accuracies": 1.0,
121
+ "rewards/chosen": 0.008165514096617699,
122
+ "rewards/margins": 0.2519247233867645,
123
+ "rewards/rejected": -0.2437591850757599,
124
+ "step": 7
125
+ },
126
+ {
127
+ "epoch": 0.09142857142857143,
128
+ "grad_norm": 3.668226480484009,
129
+ "learning_rate": 4.992840113199131e-06,
130
+ "logits/chosen": -0.06199551001191139,
131
+ "logits/rejected": 1.0075984001159668,
132
+ "logps/chosen": -31.54962158203125,
133
+ "logps/rejected": -48.84445571899414,
134
+ "loss": 0.5925,
135
+ "rewards/accuracies": 1.0,
136
+ "rewards/chosen": 0.006166815757751465,
137
+ "rewards/margins": 0.21949976682662964,
138
+ "rewards/rejected": -0.21333293616771698,
139
+ "step": 8
140
+ },
141
+ {
142
+ "epoch": 0.10285714285714286,
143
+ "grad_norm": 4.007819652557373,
144
+ "learning_rate": 4.983899869907963e-06,
145
+ "logits/chosen": 0.04794704169034958,
146
+ "logits/rejected": 1.0474152565002441,
147
+ "logps/chosen": -74.90632629394531,
148
+ "logps/rejected": -68.87115478515625,
149
+ "loss": 0.5221,
150
+ "rewards/accuracies": 1.0,
151
+ "rewards/chosen": 0.017194844782352448,
152
+ "rewards/margins": 0.40241336822509766,
153
+ "rewards/rejected": -0.3852185010910034,
154
+ "step": 9
155
+ },
156
+ {
157
+ "epoch": 0.11428571428571428,
158
+ "grad_norm": 4.3215508460998535,
159
+ "learning_rate": 4.971401463979722e-06,
160
+ "logits/chosen": 0.11494935303926468,
161
+ "logits/rejected": 1.1323603391647339,
162
+ "logps/chosen": -57.83014678955078,
163
+ "logps/rejected": -69.66509246826172,
164
+ "loss": 0.4632,
165
+ "rewards/accuracies": 1.0,
166
+ "rewards/chosen": 0.035677470266819,
167
+ "rewards/margins": 0.5738754868507385,
168
+ "rewards/rejected": -0.5381979942321777,
169
+ "step": 10
170
+ },
171
+ {
172
+ "epoch": 0.12571428571428572,
173
+ "grad_norm": 3.5642457008361816,
174
+ "learning_rate": 4.955362799260507e-06,
175
+ "logits/chosen": -0.14375551044940948,
176
+ "logits/rejected": 0.6537873148918152,
177
+ "logps/chosen": -53.47944259643555,
178
+ "logps/rejected": -81.25194549560547,
179
+ "loss": 0.4828,
180
+ "rewards/accuracies": 1.0,
181
+ "rewards/chosen": 0.019211266189813614,
182
+ "rewards/margins": 0.5275158882141113,
183
+ "rewards/rejected": -0.5083046555519104,
184
+ "step": 11
185
+ },
186
+ {
187
+ "epoch": 0.13714285714285715,
188
+ "grad_norm": 3.5064291954040527,
189
+ "learning_rate": 4.935806850983034e-06,
190
+ "logits/chosen": -0.02809108793735504,
191
+ "logits/rejected": 1.3847907781600952,
192
+ "logps/chosen": -54.27452850341797,
193
+ "logps/rejected": -84.8036117553711,
194
+ "loss": 0.3669,
195
+ "rewards/accuracies": 1.0,
196
+ "rewards/chosen": 0.038996659219264984,
197
+ "rewards/margins": 0.9113224744796753,
198
+ "rewards/rejected": -0.8723257184028625,
199
+ "step": 12
200
+ },
201
+ {
202
+ "epoch": 0.14857142857142858,
203
+ "grad_norm": 4.0220561027526855,
204
+ "learning_rate": 4.912761632854834e-06,
205
+ "logits/chosen": -0.40826213359832764,
206
+ "logits/rejected": 1.0781131982803345,
207
+ "logps/chosen": -80.10173797607422,
208
+ "logps/rejected": -64.88600158691406,
209
+ "loss": 0.4242,
210
+ "rewards/accuracies": 1.0,
211
+ "rewards/chosen": 0.028980137780308723,
212
+ "rewards/margins": 0.7560938000679016,
213
+ "rewards/rejected": -0.727113664150238,
214
+ "step": 13
215
+ },
216
+ {
217
+ "epoch": 0.16,
218
+ "grad_norm": 3.641127347946167,
219
+ "learning_rate": 4.8862601569288885e-06,
220
+ "logits/chosen": -0.3284621238708496,
221
+ "logits/rejected": 0.6769169569015503,
222
+ "logps/chosen": -126.9131088256836,
223
+ "logps/rejected": -108.0735855102539,
224
+ "loss": 0.378,
225
+ "rewards/accuracies": 1.0,
226
+ "rewards/chosen": 0.10002796351909637,
227
+ "rewards/margins": 0.9067593812942505,
228
+ "rewards/rejected": -0.8067314028739929,
229
+ "step": 14
230
+ },
231
+ {
232
+ "epoch": 0.17142857142857143,
233
+ "grad_norm": 3.1787471771240234,
234
+ "learning_rate": 4.8563403863141825e-06,
235
+ "logits/chosen": -0.23578333854675293,
236
+ "logits/rejected": 0.8872382044792175,
237
+ "logps/chosen": -77.02982330322266,
238
+ "logps/rejected": -91.4344482421875,
239
+ "loss": 0.3247,
240
+ "rewards/accuracies": 1.0,
241
+ "rewards/chosen": -0.0036322600208222866,
242
+ "rewards/margins": 1.1259247064590454,
243
+ "rewards/rejected": -1.1295570135116577,
244
+ "step": 15
245
+ },
246
+ {
247
+ "epoch": 0.18285714285714286,
248
+ "grad_norm": 3.3664069175720215,
249
+ "learning_rate": 4.823045180793914e-06,
250
+ "logits/chosen": -0.33357855677604675,
251
+ "logits/rejected": 0.9027751088142395,
252
+ "logps/chosen": -57.791385650634766,
253
+ "logps/rejected": -71.88220977783203,
254
+ "loss": 0.3925,
255
+ "rewards/accuracies": 1.0,
256
+ "rewards/chosen": 0.03762559965252876,
257
+ "rewards/margins": 0.8615567684173584,
258
+ "rewards/rejected": -0.823931097984314,
259
+ "step": 16
260
+ },
261
+ {
262
+ "epoch": 0.19428571428571428,
263
+ "grad_norm": 2.321681261062622,
264
+ "learning_rate": 4.786422235429269e-06,
265
+ "logits/chosen": -0.2371266484260559,
266
+ "logits/rejected": 0.4381519556045532,
267
+ "logps/chosen": -45.621620178222656,
268
+ "logps/rejected": -89.46638488769531,
269
+ "loss": 0.3503,
270
+ "rewards/accuracies": 1.0,
271
+ "rewards/chosen": 0.028645562008023262,
272
+ "rewards/margins": 1.0791183710098267,
273
+ "rewards/rejected": -1.0504727363586426,
274
+ "step": 17
275
+ },
276
+ {
277
+ "epoch": 0.2057142857142857,
278
+ "grad_norm": 2.6169960498809814,
279
+ "learning_rate": 4.746524012236706e-06,
280
+ "logits/chosen": -0.1888342797756195,
281
+ "logits/rejected": 0.44934579730033875,
282
+ "logps/chosen": -69.54957580566406,
283
+ "logps/rejected": -59.541568756103516,
284
+ "loss": 0.4125,
285
+ "rewards/accuracies": 1.0,
286
+ "rewards/chosen": 0.0358089953660965,
287
+ "rewards/margins": 0.8032007813453674,
288
+ "rewards/rejected": -0.7673917412757874,
289
+ "step": 18
290
+ },
291
+ {
292
+ "epoch": 0.21714285714285714,
293
+ "grad_norm": 2.923261880874634,
294
+ "learning_rate": 4.703407665036622e-06,
295
+ "logits/chosen": -0.20129157602787018,
296
+ "logits/rejected": 0.6290000677108765,
297
+ "logps/chosen": -56.686153411865234,
298
+ "logps/rejected": -87.55162048339844,
299
+ "loss": 0.264,
300
+ "rewards/accuracies": 1.0,
301
+ "rewards/chosen": 0.054906971752643585,
302
+ "rewards/margins": 1.5454007387161255,
303
+ "rewards/rejected": -1.4904940128326416,
304
+ "step": 19
305
+ },
306
+ {
307
+ "epoch": 0.22857142857142856,
308
+ "grad_norm": 2.864265203475952,
309
+ "learning_rate": 4.657134957581057e-06,
310
+ "logits/chosen": -0.3821311295032501,
311
+ "logits/rejected": 0.48754024505615234,
312
+ "logps/chosen": -62.24723815917969,
313
+ "logps/rejected": -60.93783950805664,
314
+ "loss": 0.3685,
315
+ "rewards/accuracies": 1.0,
316
+ "rewards/chosen": 0.06970775872468948,
317
+ "rewards/margins": 1.0107057094573975,
318
+ "rewards/rejected": -0.9409979581832886,
319
+ "step": 20
320
+ },
321
+ {
322
+ "epoch": 0.24,
323
+ "grad_norm": 1.9049395322799683,
324
+ "learning_rate": 4.607772175077712e-06,
325
+ "logits/chosen": -0.5025634765625,
326
+ "logits/rejected": 0.4401867389678955,
327
+ "logps/chosen": -57.89384460449219,
328
+ "logps/rejected": -79.51171112060547,
329
+ "loss": 0.3142,
330
+ "rewards/accuracies": 1.0,
331
+ "rewards/chosen": 0.049478232860565186,
332
+ "rewards/margins": 1.3050354719161987,
333
+ "rewards/rejected": -1.2555571794509888,
334
+ "step": 21
335
+ },
336
+ {
337
+ "epoch": 0.25142857142857145,
338
+ "grad_norm": 2.7351036071777344,
339
+ "learning_rate": 4.555390029237026e-06,
340
+ "logits/chosen": -0.36178550124168396,
341
+ "logits/rejected": 0.8178424835205078,
342
+ "logps/chosen": -65.52536010742188,
343
+ "logps/rejected": -100.3760986328125,
344
+ "loss": 0.2818,
345
+ "rewards/accuracies": 0.9375,
346
+ "rewards/chosen": -0.06696957349777222,
347
+ "rewards/margins": 1.5236375331878662,
348
+ "rewards/rejected": -1.5906071662902832,
349
+ "step": 22
350
+ },
351
+ {
352
+ "epoch": 0.25142857142857145,
353
+ "eval_logits/chosen": -0.36531969904899597,
354
+ "eval_logits/rejected": 0.3482947051525116,
355
+ "eval_logps/chosen": -87.77478790283203,
356
+ "eval_logps/rejected": -92.11418914794922,
357
+ "eval_loss": 0.30896151065826416,
358
+ "eval_rewards/accuracies": 0.9800000190734863,
359
+ "eval_rewards/chosen": -0.20244216918945312,
360
+ "eval_rewards/margins": 1.3565798997879028,
361
+ "eval_rewards/rejected": -1.559022068977356,
362
+ "eval_runtime": 209.0014,
363
+ "eval_samples_per_second": 0.957,
364
+ "eval_steps_per_second": 0.957,
365
+ "step": 22
366
+ },
367
+ {
368
+ "epoch": 0.26285714285714284,
369
+ "grad_norm": 2.936436653137207,
370
+ "learning_rate": 4.5000635569783365e-06,
371
+ "logits/chosen": -0.278434157371521,
372
+ "logits/rejected": 0.1438252478837967,
373
+ "logps/chosen": -70.02806091308594,
374
+ "logps/rejected": -57.32536697387695,
375
+ "loss": 0.3441,
376
+ "rewards/accuracies": 1.0,
377
+ "rewards/chosen": 0.005648649297654629,
378
+ "rewards/margins": 1.069925308227539,
379
+ "rewards/rejected": -1.0642765760421753,
380
+ "step": 23
381
+ },
382
+ {
383
+ "epoch": 0.2742857142857143,
384
+ "grad_norm": 1.480675458908081,
385
+ "learning_rate": 4.4418720129402145e-06,
386
+ "logits/chosen": -0.6613065004348755,
387
+ "logits/rejected": 0.20875723659992218,
388
+ "logps/chosen": -43.0631217956543,
389
+ "logps/rejected": -113.96063995361328,
390
+ "loss": 0.2264,
391
+ "rewards/accuracies": 1.0,
392
+ "rewards/chosen": 0.007623173296451569,
393
+ "rewards/margins": 1.854811191558838,
394
+ "rewards/rejected": -1.8471879959106445,
395
+ "step": 24
396
+ },
397
+ {
398
+ "epoch": 0.2857142857142857,
399
+ "grad_norm": 2.0406107902526855,
400
+ "learning_rate": 4.3808987559489536e-06,
401
+ "logits/chosen": -0.4824203848838806,
402
+ "logits/rejected": 0.370841383934021,
403
+ "logps/chosen": -39.89043426513672,
404
+ "logps/rejected": -89.99382781982422,
405
+ "loss": 0.2224,
406
+ "rewards/accuracies": 1.0,
407
+ "rewards/chosen": 0.0602618083357811,
408
+ "rewards/margins": 1.6918809413909912,
409
+ "rewards/rejected": -1.6316192150115967,
410
+ "step": 25
411
+ },
412
+ {
413
+ "epoch": 0.29714285714285715,
414
+ "grad_norm": 2.2385094165802,
415
+ "learning_rate": 4.317231129607859e-06,
416
+ "logits/chosen": -0.5961613655090332,
417
+ "logits/rejected": 0.14968276023864746,
418
+ "logps/chosen": -76.45050048828125,
419
+ "logps/rejected": -99.48614501953125,
420
+ "loss": 0.2123,
421
+ "rewards/accuracies": 1.0,
422
+ "rewards/chosen": 0.07128332555294037,
423
+ "rewards/margins": 1.763782024383545,
424
+ "rewards/rejected": -1.6924986839294434,
425
+ "step": 26
426
+ },
427
+ {
428
+ "epoch": 0.30857142857142855,
429
+ "grad_norm": 1.6301268339157104,
430
+ "learning_rate": 4.2509603371783776e-06,
431
+ "logits/chosen": -0.3383774161338806,
432
+ "logits/rejected": 0.15638643503189087,
433
+ "logps/chosen": -58.246971130371094,
434
+ "logps/rejected": -79.45714569091797,
435
+ "loss": 0.2009,
436
+ "rewards/accuracies": 1.0,
437
+ "rewards/chosen": -0.04440131038427353,
438
+ "rewards/margins": 1.9561799764633179,
439
+ "rewards/rejected": -2.0005815029144287,
440
+ "step": 27
441
+ },
442
+ {
443
+ "epoch": 0.32,
444
+ "grad_norm": 2.236377716064453,
445
+ "learning_rate": 4.1821813109322975e-06,
446
+ "logits/chosen": -0.647399365901947,
447
+ "logits/rejected": 0.22453227639198303,
448
+ "logps/chosen": -88.88107299804688,
449
+ "logps/rejected": -96.83210754394531,
450
+ "loss": 0.2263,
451
+ "rewards/accuracies": 1.0,
452
+ "rewards/chosen": 0.040186457335948944,
453
+ "rewards/margins": 1.824659824371338,
454
+ "rewards/rejected": -1.7844732999801636,
455
+ "step": 28
456
+ },
457
+ {
458
+ "epoch": 0.3314285714285714,
459
+ "grad_norm": 2.0542852878570557,
460
+ "learning_rate": 4.110992576162193e-06,
461
+ "logits/chosen": -0.5227777361869812,
462
+ "logits/rejected": -0.2961636781692505,
463
+ "logps/chosen": -78.49622344970703,
464
+ "logps/rejected": -78.24589538574219,
465
+ "loss": 0.2121,
466
+ "rewards/accuracies": 1.0,
467
+ "rewards/chosen": 0.10791393369436264,
468
+ "rewards/margins": 1.7918672561645508,
469
+ "rewards/rejected": -1.6839532852172852,
470
+ "step": 29
471
+ },
472
+ {
473
+ "epoch": 0.34285714285714286,
474
+ "grad_norm": 1.9906846284866333,
475
+ "learning_rate": 4.037496110044885e-06,
476
+ "logits/chosen": -0.44146519899368286,
477
+ "logits/rejected": 0.24826864898204803,
478
+ "logps/chosen": -89.6866683959961,
479
+ "logps/rejected": -122.11793518066406,
480
+ "loss": 0.1621,
481
+ "rewards/accuracies": 1.0,
482
+ "rewards/chosen": -0.04959860444068909,
483
+ "rewards/margins": 2.5837507247924805,
484
+ "rewards/rejected": -2.6333494186401367,
485
+ "step": 30
486
+ },
487
+ {
488
+ "epoch": 0.35428571428571426,
489
+ "grad_norm": 2.3201839923858643,
490
+ "learning_rate": 3.961797195560118e-06,
491
+ "logits/chosen": -0.37571054697036743,
492
+ "logits/rejected": -0.12684349715709686,
493
+ "logps/chosen": -62.36381530761719,
494
+ "logps/rejected": -68.8594741821289,
495
+ "loss": 0.2406,
496
+ "rewards/accuracies": 1.0,
497
+ "rewards/chosen": 0.013891173526644707,
498
+ "rewards/margins": 1.7061822414398193,
499
+ "rewards/rejected": -1.6922911405563354,
500
+ "step": 31
501
+ },
502
+ {
503
+ "epoch": 0.3657142857142857,
504
+ "grad_norm": 1.7459288835525513,
505
+ "learning_rate": 3.884004270673711e-06,
506
+ "logits/chosen": -0.4904371500015259,
507
+ "logits/rejected": -0.09516231715679169,
508
+ "logps/chosen": -51.67000198364258,
509
+ "logps/rejected": -87.77179718017578,
510
+ "loss": 0.1739,
511
+ "rewards/accuracies": 1.0,
512
+ "rewards/chosen": 0.05766277387738228,
513
+ "rewards/margins": 2.167266845703125,
514
+ "rewards/rejected": -2.1096038818359375,
515
+ "step": 32
516
+ },
517
+ {
518
+ "epoch": 0.37714285714285717,
519
+ "grad_norm": 1.9478814601898193,
520
+ "learning_rate": 3.8042287730012117e-06,
521
+ "logits/chosen": -0.7833026051521301,
522
+ "logits/rejected": -0.14795458316802979,
523
+ "logps/chosen": -49.5107307434082,
524
+ "logps/rejected": -77.62210845947266,
525
+ "loss": 0.1861,
526
+ "rewards/accuracies": 1.0,
527
+ "rewards/chosen": 0.02107466384768486,
528
+ "rewards/margins": 1.9514578580856323,
529
+ "rewards/rejected": -1.9303834438323975,
530
+ "step": 33
531
+ },
532
+ {
533
+ "epoch": 0.38857142857142857,
534
+ "grad_norm": 2.1133761405944824,
535
+ "learning_rate": 3.7225849801745835e-06,
536
+ "logits/chosen": -0.8189583420753479,
537
+ "logits/rejected": -0.24318619072437286,
538
+ "logps/chosen": -75.10845947265625,
539
+ "logps/rejected": -111.31871032714844,
540
+ "loss": 0.1489,
541
+ "rewards/accuracies": 1.0,
542
+ "rewards/chosen": 0.029190005734562874,
543
+ "rewards/margins": 2.6350479125976562,
544
+ "rewards/rejected": -2.6058578491210938,
545
+ "step": 34
546
+ },
547
+ {
548
+ "epoch": 0.4,
549
+ "grad_norm": 2.116342306137085,
550
+ "learning_rate": 3.6391898461406045e-06,
551
+ "logits/chosen": -0.4198293685913086,
552
+ "logits/rejected": -0.3276508152484894,
553
+ "logps/chosen": -63.513519287109375,
554
+ "logps/rejected": -93.56440734863281,
555
+ "loss": 0.2266,
556
+ "rewards/accuracies": 1.0,
557
+ "rewards/chosen": 0.09839610755443573,
558
+ "rewards/margins": 1.798091173171997,
559
+ "rewards/rejected": -1.6996949911117554,
560
+ "step": 35
561
+ },
562
+ {
563
+ "epoch": 0.4114285714285714,
564
+ "grad_norm": 1.6935662031173706,
565
+ "learning_rate": 3.55416283362546e-06,
566
+ "logits/chosen": -0.8055887222290039,
567
+ "logits/rejected": 0.15487802028656006,
568
+ "logps/chosen": -46.510643005371094,
569
+ "logps/rejected": -105.87352752685547,
570
+ "loss": 0.1607,
571
+ "rewards/accuracies": 1.0,
572
+ "rewards/chosen": 0.033490121364593506,
573
+ "rewards/margins": 2.649106025695801,
574
+ "rewards/rejected": -2.6156160831451416,
575
+ "step": 36
576
+ },
577
+ {
578
+ "epoch": 0.4228571428571429,
579
+ "grad_norm": 2.2720091342926025,
580
+ "learning_rate": 3.4676257430055438e-06,
581
+ "logits/chosen": -0.8104305267333984,
582
+ "logits/rejected": 0.04826318100094795,
583
+ "logps/chosen": -77.22013854980469,
584
+ "logps/rejected": -98.19013977050781,
585
+ "loss": 0.1415,
586
+ "rewards/accuracies": 1.0,
587
+ "rewards/chosen": 0.03917883336544037,
588
+ "rewards/margins": 2.6867618560791016,
589
+ "rewards/rejected": -2.6475830078125,
590
+ "step": 37
591
+ },
592
+ {
593
+ "epoch": 0.4342857142857143,
594
+ "grad_norm": 1.546297550201416,
595
+ "learning_rate": 3.3797025378295826e-06,
596
+ "logits/chosen": -0.8403704166412354,
597
+ "logits/rejected": 0.052355289459228516,
598
+ "logps/chosen": -56.61090087890625,
599
+ "logps/rejected": -119.7930679321289,
600
+ "loss": 0.1658,
601
+ "rewards/accuracies": 1.0,
602
+ "rewards/chosen": 0.022541070356965065,
603
+ "rewards/margins": 2.8231887817382812,
604
+ "rewards/rejected": -2.800647735595703,
605
+ "step": 38
606
+ },
607
+ {
608
+ "epoch": 0.44571428571428573,
609
+ "grad_norm": 2.0681819915771484,
610
+ "learning_rate": 3.29051916724206e-06,
611
+ "logits/chosen": -0.6301568746566772,
612
+ "logits/rejected": -0.32246649265289307,
613
+ "logps/chosen": -66.40396118164062,
614
+ "logps/rejected": -81.09312438964844,
615
+ "loss": 0.1799,
616
+ "rewards/accuracies": 1.0,
617
+ "rewards/chosen": 0.009487343952059746,
618
+ "rewards/margins": 2.2801120281219482,
619
+ "rewards/rejected": -2.2706246376037598,
620
+ "step": 39
621
+ },
622
+ {
623
+ "epoch": 0.45714285714285713,
624
+ "grad_norm": 1.4052331447601318,
625
+ "learning_rate": 3.2002033855622683e-06,
626
+ "logits/chosen": -0.8533369302749634,
627
+ "logits/rejected": -0.4283853769302368,
628
+ "logps/chosen": -47.345802307128906,
629
+ "logps/rejected": -93.77117919921875,
630
+ "loss": 0.1517,
631
+ "rewards/accuracies": 1.0,
632
+ "rewards/chosen": -0.026743369176983833,
633
+ "rewards/margins": 2.6302499771118164,
634
+ "rewards/rejected": -2.6569931507110596,
635
+ "step": 40
636
+ },
637
+ {
638
+ "epoch": 0.4685714285714286,
639
+ "grad_norm": 2.0809950828552246,
640
+ "learning_rate": 3.1088845692774798e-06,
641
+ "logits/chosen": -0.6270914077758789,
642
+ "logits/rejected": -0.6155582070350647,
643
+ "logps/chosen": -88.60835266113281,
644
+ "logps/rejected": -67.6736831665039,
645
+ "loss": 0.1825,
646
+ "rewards/accuracies": 1.0,
647
+ "rewards/chosen": 0.04146631807088852,
648
+ "rewards/margins": 2.0336129665374756,
649
+ "rewards/rejected": -1.9921468496322632,
650
+ "step": 41
651
+ },
652
+ {
653
+ "epoch": 0.48,
654
+ "grad_norm": 1.1893919706344604,
655
+ "learning_rate": 3.0166935317123824e-06,
656
+ "logits/chosen": -1.0347564220428467,
657
+ "logits/rejected": -0.4240405261516571,
658
+ "logps/chosen": -56.76289367675781,
659
+ "logps/rejected": -103.66142272949219,
660
+ "loss": 0.1124,
661
+ "rewards/accuracies": 1.0,
662
+ "rewards/chosen": -0.057413943111896515,
663
+ "rewards/margins": 3.0061051845550537,
664
+ "rewards/rejected": -3.06351900100708,
665
+ "step": 42
666
+ },
667
+ {
668
+ "epoch": 0.49142857142857144,
669
+ "grad_norm": 1.1706154346466064,
670
+ "learning_rate": 2.9237623356402423e-06,
671
+ "logits/chosen": -1.0618159770965576,
672
+ "logits/rejected": -0.327092707157135,
673
+ "logps/chosen": -32.207794189453125,
674
+ "logps/rejected": -111.8665771484375,
675
+ "loss": 0.0903,
676
+ "rewards/accuracies": 1.0,
677
+ "rewards/chosen": -0.027263116091489792,
678
+ "rewards/margins": 3.3231871128082275,
679
+ "rewards/rejected": -3.350450277328491,
680
+ "step": 43
681
+ },
682
+ {
683
+ "epoch": 0.5028571428571429,
684
+ "grad_norm": 1.079911470413208,
685
+ "learning_rate": 2.8302241041042564e-06,
686
+ "logits/chosen": -1.1862759590148926,
687
+ "logits/rejected": -0.7669480443000793,
688
+ "logps/chosen": -89.4259262084961,
689
+ "logps/rejected": -127.56314086914062,
690
+ "loss": 0.0967,
691
+ "rewards/accuracies": 1.0,
692
+ "rewards/chosen": 0.14472071826457977,
693
+ "rewards/margins": 3.0603933334350586,
694
+ "rewards/rejected": -2.915672540664673,
695
+ "step": 44
696
+ },
697
+ {
698
+ "epoch": 0.5028571428571429,
699
+ "eval_logits/chosen": -0.8571964502334595,
700
+ "eval_logits/rejected": -0.6531373858451843,
701
+ "eval_logps/chosen": -90.10453033447266,
702
+ "eval_logps/rejected": -104.75491333007812,
703
+ "eval_loss": 0.17935897409915924,
704
+ "eval_rewards/accuracies": 0.9700000286102295,
705
+ "eval_rewards/chosen": -0.4354174733161926,
706
+ "eval_rewards/margins": 2.387676954269409,
707
+ "eval_rewards/rejected": -2.8230948448181152,
708
+ "eval_runtime": 208.3973,
709
+ "eval_samples_per_second": 0.96,
710
+ "eval_steps_per_second": 0.96,
711
+ "step": 44
712
+ },
713
+ {
714
+ "epoch": 0.5142857142857142,
715
+ "grad_norm": 1.5324379205703735,
716
+ "learning_rate": 2.7362128297200784e-06,
717
+ "logits/chosen": -0.7203244566917419,
718
+ "logits/rejected": -0.5576686859130859,
719
+ "logps/chosen": -65.52645874023438,
720
+ "logps/rejected": -95.54450988769531,
721
+ "loss": 0.1323,
722
+ "rewards/accuracies": 1.0,
723
+ "rewards/chosen": 0.1149684339761734,
724
+ "rewards/margins": 2.6911990642547607,
725
+ "rewards/rejected": -2.576230525970459,
726
+ "step": 45
727
+ },
728
+ {
729
+ "epoch": 0.5257142857142857,
730
+ "grad_norm": 1.2247161865234375,
731
+ "learning_rate": 2.6418631827326857e-06,
732
+ "logits/chosen": -0.9313367009162903,
733
+ "logits/rejected": -0.8070792555809021,
734
+ "logps/chosen": -55.876502990722656,
735
+ "logps/rejected": -119.91787719726562,
736
+ "loss": 0.1285,
737
+ "rewards/accuracies": 1.0,
738
+ "rewards/chosen": 0.06400280445814133,
739
+ "rewards/margins": 2.901925802230835,
740
+ "rewards/rejected": -2.837923288345337,
741
+ "step": 46
742
+ },
743
+ {
744
+ "epoch": 0.5371428571428571,
745
+ "grad_norm": 1.3425116539001465,
746
+ "learning_rate": 2.547310318102548e-06,
747
+ "logits/chosen": -0.9409236907958984,
748
+ "logits/rejected": -0.7352248430252075,
749
+ "logps/chosen": -50.5601806640625,
750
+ "logps/rejected": -86.23294830322266,
751
+ "loss": 0.1466,
752
+ "rewards/accuracies": 1.0,
753
+ "rewards/chosen": 0.09888257831335068,
754
+ "rewards/margins": 2.470425844192505,
755
+ "rewards/rejected": -2.3715431690216064,
756
+ "step": 47
757
+ },
758
+ {
759
+ "epoch": 0.5485714285714286,
760
+ "grad_norm": 1.4391740560531616,
761
+ "learning_rate": 2.4526896818974534e-06,
762
+ "logits/chosen": -0.8374643921852112,
763
+ "logits/rejected": -0.47213953733444214,
764
+ "logps/chosen": -50.190616607666016,
765
+ "logps/rejected": -91.12651824951172,
766
+ "loss": 0.1023,
767
+ "rewards/accuracies": 1.0,
768
+ "rewards/chosen": -0.009993518702685833,
769
+ "rewards/margins": 2.796506881713867,
770
+ "rewards/rejected": -2.8065006732940674,
771
+ "step": 48
772
+ },
773
+ {
774
+ "epoch": 0.56,
775
+ "grad_norm": 1.5294134616851807,
776
+ "learning_rate": 2.358136817267315e-06,
777
+ "logits/chosen": -0.8648539185523987,
778
+ "logits/rejected": -0.736384391784668,
779
+ "logps/chosen": -72.85952758789062,
780
+ "logps/rejected": -83.08409881591797,
781
+ "loss": 0.1516,
782
+ "rewards/accuracies": 1.0,
783
+ "rewards/chosen": 0.09306713193655014,
784
+ "rewards/margins": 2.5247979164123535,
785
+ "rewards/rejected": -2.4317305088043213,
786
+ "step": 49
787
+ },
788
+ {
789
+ "epoch": 0.5714285714285714,
790
+ "grad_norm": 1.6909253597259521,
791
+ "learning_rate": 2.263787170279922e-06,
792
+ "logits/chosen": -1.3599584102630615,
793
+ "logits/rejected": -1.2676033973693848,
794
+ "logps/chosen": -78.65673065185547,
795
+ "logps/rejected": -69.09491729736328,
796
+ "loss": 0.1557,
797
+ "rewards/accuracies": 1.0,
798
+ "rewards/chosen": 0.00439932756125927,
799
+ "rewards/margins": 2.1822092533111572,
800
+ "rewards/rejected": -2.177809953689575,
801
+ "step": 50
802
+ },
803
+ {
804
+ "epoch": 0.5828571428571429,
805
+ "grad_norm": 1.3136837482452393,
806
+ "learning_rate": 2.169775895895745e-06,
807
+ "logits/chosen": -0.7750363349914551,
808
+ "logits/rejected": -0.7582042217254639,
809
+ "logps/chosen": -48.27521514892578,
810
+ "logps/rejected": -105.779541015625,
811
+ "loss": 0.0944,
812
+ "rewards/accuracies": 1.0,
813
+ "rewards/chosen": 0.060845933854579926,
814
+ "rewards/margins": 3.2103078365325928,
815
+ "rewards/rejected": -3.1494617462158203,
816
+ "step": 51
817
+ },
818
+ {
819
+ "epoch": 0.5942857142857143,
820
+ "grad_norm": 1.304816722869873,
821
+ "learning_rate": 2.0762376643597586e-06,
822
+ "logits/chosen": -0.7206559777259827,
823
+ "logits/rejected": -0.7368943691253662,
824
+ "logps/chosen": -49.27516174316406,
825
+ "logps/rejected": -99.28387451171875,
826
+ "loss": 0.1227,
827
+ "rewards/accuracies": 1.0,
828
+ "rewards/chosen": 0.08159955590963364,
829
+ "rewards/margins": 2.943441390991211,
830
+ "rewards/rejected": -2.861841917037964,
831
+ "step": 52
832
+ },
833
+ {
834
+ "epoch": 0.6057142857142858,
835
+ "grad_norm": 1.1686677932739258,
836
+ "learning_rate": 1.9833064682876175e-06,
837
+ "logits/chosen": -0.7927972674369812,
838
+ "logits/rejected": -0.8789339065551758,
839
+ "logps/chosen": -62.97304916381836,
840
+ "logps/rejected": -93.07855224609375,
841
+ "loss": 0.097,
842
+ "rewards/accuracies": 1.0,
843
+ "rewards/chosen": 0.10683320462703705,
844
+ "rewards/margins": 2.952019453048706,
845
+ "rewards/rejected": -2.8451859951019287,
846
+ "step": 53
847
+ },
848
+ {
849
+ "epoch": 0.6171428571428571,
850
+ "grad_norm": 0.7459912300109863,
851
+ "learning_rate": 1.8911154307225204e-06,
852
+ "logits/chosen": -0.7670217752456665,
853
+ "logits/rejected": -0.7017982006072998,
854
+ "logps/chosen": -31.30267333984375,
855
+ "logps/rejected": -110.78553771972656,
856
+ "loss": 0.0593,
857
+ "rewards/accuracies": 1.0,
858
+ "rewards/chosen": 0.003862532787024975,
859
+ "rewards/margins": 3.5174167156219482,
860
+ "rewards/rejected": -3.513554096221924,
861
+ "step": 54
862
+ },
863
+ {
864
+ "epoch": 0.6285714285714286,
865
+ "grad_norm": 1.5418952703475952,
866
+ "learning_rate": 1.7997966144377328e-06,
867
+ "logits/chosen": -0.986474871635437,
868
+ "logits/rejected": -1.1061036586761475,
869
+ "logps/chosen": -47.49861526489258,
870
+ "logps/rejected": -67.53656005859375,
871
+ "loss": 0.1543,
872
+ "rewards/accuracies": 1.0,
873
+ "rewards/chosen": -0.04688534885644913,
874
+ "rewards/margins": 2.227695941925049,
875
+ "rewards/rejected": -2.27458119392395,
876
+ "step": 55
877
+ },
878
+ {
879
+ "epoch": 0.64,
880
+ "grad_norm": 1.0748093128204346,
881
+ "learning_rate": 1.7094808327579401e-06,
882
+ "logits/chosen": -1.324556589126587,
883
+ "logits/rejected": -0.8223966360092163,
884
+ "logps/chosen": -36.40914535522461,
885
+ "logps/rejected": -105.08839416503906,
886
+ "loss": 0.084,
887
+ "rewards/accuracies": 1.0,
888
+ "rewards/chosen": -0.07963553071022034,
889
+ "rewards/margins": 3.377859354019165,
890
+ "rewards/rejected": -3.4574952125549316,
891
+ "step": 56
892
+ },
893
+ {
894
+ "epoch": 0.6514285714285715,
895
+ "grad_norm": 0.9280484318733215,
896
+ "learning_rate": 1.6202974621704176e-06,
897
+ "logits/chosen": -1.450647234916687,
898
+ "logits/rejected": -0.8040248155593872,
899
+ "logps/chosen": -68.76046752929688,
900
+ "logps/rejected": -125.3299331665039,
901
+ "loss": 0.0635,
902
+ "rewards/accuracies": 1.0,
903
+ "rewards/chosen": 0.06499414145946503,
904
+ "rewards/margins": 3.9410018920898438,
905
+ "rewards/rejected": -3.876007318496704,
906
+ "step": 57
907
+ },
908
+ {
909
+ "epoch": 0.6628571428571428,
910
+ "grad_norm": 0.8896822333335876,
911
+ "learning_rate": 1.5323742569944573e-06,
912
+ "logits/chosen": -1.0071394443511963,
913
+ "logits/rejected": -1.0022106170654297,
914
+ "logps/chosen": -45.09584426879883,
915
+ "logps/rejected": -109.64781951904297,
916
+ "loss": 0.0802,
917
+ "rewards/accuracies": 1.0,
918
+ "rewards/chosen": 0.034890901297330856,
919
+ "rewards/margins": 3.5162737369537354,
920
+ "rewards/rejected": -3.4813833236694336,
921
+ "step": 58
922
+ },
923
+ {
924
+ "epoch": 0.6742857142857143,
925
+ "grad_norm": 0.7682043313980103,
926
+ "learning_rate": 1.44583716637454e-06,
927
+ "logits/chosen": -1.0028694868087769,
928
+ "logits/rejected": -0.813642144203186,
929
+ "logps/chosen": -66.2764663696289,
930
+ "logps/rejected": -112.77369689941406,
931
+ "loss": 0.0576,
932
+ "rewards/accuracies": 1.0,
933
+ "rewards/chosen": -0.0501595139503479,
934
+ "rewards/margins": 3.7721147537231445,
935
+ "rewards/rejected": -3.822274684906006,
936
+ "step": 59
937
+ },
938
+ {
939
+ "epoch": 0.6857142857142857,
940
+ "grad_norm": 1.0216327905654907,
941
+ "learning_rate": 1.3608101538593965e-06,
942
+ "logits/chosen": -1.1250649690628052,
943
+ "logits/rejected": -0.9627130627632141,
944
+ "logps/chosen": -42.440757751464844,
945
+ "logps/rejected": -100.12843322753906,
946
+ "loss": 0.0804,
947
+ "rewards/accuracies": 1.0,
948
+ "rewards/chosen": 0.11411059647798538,
949
+ "rewards/margins": 3.393651247024536,
950
+ "rewards/rejected": -3.2795403003692627,
951
+ "step": 60
952
+ },
953
+ {
954
+ "epoch": 0.6971428571428572,
955
+ "grad_norm": 0.7271348834037781,
956
+ "learning_rate": 1.277415019825417e-06,
957
+ "logits/chosen": -0.7807080745697021,
958
+ "logits/rejected": -0.7796292304992676,
959
+ "logps/chosen": -33.5434455871582,
960
+ "logps/rejected": -112.23175048828125,
961
+ "loss": 0.0711,
962
+ "rewards/accuracies": 1.0,
963
+ "rewards/chosen": -0.06058162823319435,
964
+ "rewards/margins": 3.8745694160461426,
965
+ "rewards/rejected": -3.9351511001586914,
966
+ "step": 61
967
+ },
968
+ {
969
+ "epoch": 0.7085714285714285,
970
+ "grad_norm": 1.7274105548858643,
971
+ "learning_rate": 1.195771226998789e-06,
972
+ "logits/chosen": -0.9823087453842163,
973
+ "logits/rejected": -1.2148367166519165,
974
+ "logps/chosen": -72.55377960205078,
975
+ "logps/rejected": -75.32920837402344,
976
+ "loss": 0.1183,
977
+ "rewards/accuracies": 1.0,
978
+ "rewards/chosen": -0.12965497374534607,
979
+ "rewards/margins": 2.7459590435028076,
980
+ "rewards/rejected": -2.8756141662597656,
981
+ "step": 62
982
+ },
983
+ {
984
+ "epoch": 0.72,
985
+ "grad_norm": 0.9623571038246155,
986
+ "learning_rate": 1.1159957293262888e-06,
987
+ "logits/chosen": -1.0808844566345215,
988
+ "logits/rejected": -0.8635554909706116,
989
+ "logps/chosen": -49.637996673583984,
990
+ "logps/rejected": -116.99398803710938,
991
+ "loss": 0.09,
992
+ "rewards/accuracies": 1.0,
993
+ "rewards/chosen": 0.02851293236017227,
994
+ "rewards/margins": 3.4344334602355957,
995
+ "rewards/rejected": -3.4059205055236816,
996
+ "step": 63
997
+ },
998
+ {
999
+ "epoch": 0.7314285714285714,
1000
+ "grad_norm": 1.0066514015197754,
1001
+ "learning_rate": 1.0382028044398823e-06,
1002
+ "logits/chosen": -1.197101354598999,
1003
+ "logits/rejected": -1.1306017637252808,
1004
+ "logps/chosen": -50.98615264892578,
1005
+ "logps/rejected": -120.8044662475586,
1006
+ "loss": 0.0899,
1007
+ "rewards/accuracies": 1.0,
1008
+ "rewards/chosen": -0.035914015024900436,
1009
+ "rewards/margins": 3.1908507347106934,
1010
+ "rewards/rejected": -3.2267649173736572,
1011
+ "step": 64
1012
+ },
1013
+ {
1014
+ "epoch": 0.7428571428571429,
1015
+ "grad_norm": 1.1005553007125854,
1016
+ "learning_rate": 9.625038899551162e-07,
1017
+ "logits/chosen": -1.22350013256073,
1018
+ "logits/rejected": -1.1208860874176025,
1019
+ "logps/chosen": -66.32962036132812,
1020
+ "logps/rejected": -103.34649658203125,
1021
+ "loss": 0.0709,
1022
+ "rewards/accuracies": 1.0,
1023
+ "rewards/chosen": 0.18690410256385803,
1024
+ "rewards/margins": 3.4826159477233887,
1025
+ "rewards/rejected": -3.2957119941711426,
1026
+ "step": 65
1027
+ },
1028
+ {
1029
+ "epoch": 0.7542857142857143,
1030
+ "grad_norm": 0.954483687877655,
1031
+ "learning_rate": 8.890074238378074e-07,
1032
+ "logits/chosen": -0.9665268659591675,
1033
+ "logits/rejected": -0.8029574751853943,
1034
+ "logps/chosen": -43.259857177734375,
1035
+ "logps/rejected": -104.5782241821289,
1036
+ "loss": 0.0993,
1037
+ "rewards/accuracies": 1.0,
1038
+ "rewards/chosen": -0.044777870178222656,
1039
+ "rewards/margins": 3.1982903480529785,
1040
+ "rewards/rejected": -3.243067979812622,
1041
+ "step": 66
1042
+ },
1043
+ {
1044
+ "epoch": 0.7542857142857143,
1045
+ "eval_logits/chosen": -1.1089446544647217,
1046
+ "eval_logits/rejected": -1.1692878007888794,
1047
+ "eval_logps/chosen": -91.48172760009766,
1048
+ "eval_logps/rejected": -110.86624145507812,
1049
+ "eval_loss": 0.14132851362228394,
1050
+ "eval_rewards/accuracies": 0.9700000286102295,
1051
+ "eval_rewards/chosen": -0.573137104511261,
1052
+ "eval_rewards/margins": 2.8610901832580566,
1053
+ "eval_rewards/rejected": -3.4342269897460938,
1054
+ "eval_runtime": 208.8549,
1055
+ "eval_samples_per_second": 0.958,
1056
+ "eval_steps_per_second": 0.958,
1057
+ "step": 66
1058
+ },
1059
+ {
1060
+ "epoch": 0.7657142857142857,
1061
+ "grad_norm": 0.9773061871528625,
1062
+ "learning_rate": 8.178186890677029e-07,
1063
+ "logits/chosen": -1.02699875831604,
1064
+ "logits/rejected": -1.1385068893432617,
1065
+ "logps/chosen": -80.82888793945312,
1066
+ "logps/rejected": -100.25572967529297,
1067
+ "loss": 0.072,
1068
+ "rewards/accuracies": 1.0,
1069
+ "rewards/chosen": 0.0796530619263649,
1070
+ "rewards/margins": 3.1960816383361816,
1071
+ "rewards/rejected": -3.116428852081299,
1072
+ "step": 67
1073
+ },
1074
+ {
1075
+ "epoch": 0.7771428571428571,
1076
+ "grad_norm": 1.2940922975540161,
1077
+ "learning_rate": 7.490396628216237e-07,
1078
+ "logits/chosen": -1.2090729475021362,
1079
+ "logits/rejected": -1.2437564134597778,
1080
+ "logps/chosen": -87.85923767089844,
1081
+ "logps/rejected": -120.87287902832031,
1082
+ "loss": 0.1183,
1083
+ "rewards/accuracies": 1.0,
1084
+ "rewards/chosen": 0.018895722925662994,
1085
+ "rewards/margins": 2.969498634338379,
1086
+ "rewards/rejected": -2.9506030082702637,
1087
+ "step": 68
1088
+ },
1089
+ {
1090
+ "epoch": 0.7885714285714286,
1091
+ "grad_norm": 0.7793561220169067,
1092
+ "learning_rate": 6.827688703921407e-07,
1093
+ "logits/chosen": -1.1516605615615845,
1094
+ "logits/rejected": -1.295521855354309,
1095
+ "logps/chosen": -52.94973373413086,
1096
+ "logps/rejected": -84.64179229736328,
1097
+ "loss": 0.067,
1098
+ "rewards/accuracies": 1.0,
1099
+ "rewards/chosen": 0.18537920713424683,
1100
+ "rewards/margins": 3.4953463077545166,
1101
+ "rewards/rejected": -3.309967041015625,
1102
+ "step": 69
1103
+ },
1104
+ {
1105
+ "epoch": 0.8,
1106
+ "grad_norm": 1.4742248058319092,
1107
+ "learning_rate": 6.191012440510469e-07,
1108
+ "logits/chosen": -1.3784356117248535,
1109
+ "logits/rejected": -1.3366318941116333,
1110
+ "logps/chosen": -57.7204475402832,
1111
+ "logps/rejected": -90.2862548828125,
1112
+ "loss": 0.1197,
1113
+ "rewards/accuracies": 1.0,
1114
+ "rewards/chosen": -0.044269490987062454,
1115
+ "rewards/margins": 2.759215831756592,
1116
+ "rewards/rejected": -2.80348539352417,
1117
+ "step": 70
1118
+ },
1119
+ {
1120
+ "epoch": 0.8114285714285714,
1121
+ "grad_norm": 0.7249897718429565,
1122
+ "learning_rate": 5.581279870597866e-07,
1123
+ "logits/chosen": -1.1907292604446411,
1124
+ "logits/rejected": -0.6756631731987,
1125
+ "logps/chosen": -32.33828353881836,
1126
+ "logps/rejected": -125.02144622802734,
1127
+ "loss": 0.0525,
1128
+ "rewards/accuracies": 1.0,
1129
+ "rewards/chosen": -0.06472505629062653,
1130
+ "rewards/margins": 4.0654168128967285,
1131
+ "rewards/rejected": -4.130141258239746,
1132
+ "step": 71
1133
+ },
1134
+ {
1135
+ "epoch": 0.8228571428571428,
1136
+ "grad_norm": 1.0847841501235962,
1137
+ "learning_rate": 4.999364430216639e-07,
1138
+ "logits/chosen": -1.237339735031128,
1139
+ "logits/rejected": -1.5806419849395752,
1140
+ "logps/chosen": -52.456146240234375,
1141
+ "logps/rejected": -94.31544494628906,
1142
+ "loss": 0.0992,
1143
+ "rewards/accuracies": 1.0,
1144
+ "rewards/chosen": 0.10363951325416565,
1145
+ "rewards/margins": 2.9890761375427246,
1146
+ "rewards/rejected": -2.885436534881592,
1147
+ "step": 72
1148
+ },
1149
+ {
1150
+ "epoch": 0.8342857142857143,
1151
+ "grad_norm": 1.278956651687622,
1152
+ "learning_rate": 4.4460997076297504e-07,
1153
+ "logits/chosen": -1.0774935483932495,
1154
+ "logits/rejected": -1.4760003089904785,
1155
+ "logps/chosen": -43.07012939453125,
1156
+ "logps/rejected": -74.25629425048828,
1157
+ "loss": 0.1131,
1158
+ "rewards/accuracies": 1.0,
1159
+ "rewards/chosen": 0.06534770131111145,
1160
+ "rewards/margins": 2.8206787109375,
1161
+ "rewards/rejected": -2.75533127784729,
1162
+ "step": 73
1163
+ },
1164
+ {
1165
+ "epoch": 0.8457142857142858,
1166
+ "grad_norm": 0.7833404541015625,
1167
+ "learning_rate": 3.922278249222894e-07,
1168
+ "logits/chosen": -1.1311602592468262,
1169
+ "logits/rejected": -1.0242271423339844,
1170
+ "logps/chosen": -53.541568756103516,
1171
+ "logps/rejected": -105.48152923583984,
1172
+ "loss": 0.0774,
1173
+ "rewards/accuracies": 1.0,
1174
+ "rewards/chosen": 0.04792798310518265,
1175
+ "rewards/margins": 3.678433418273926,
1176
+ "rewards/rejected": -3.6305058002471924,
1177
+ "step": 74
1178
+ },
1179
+ {
1180
+ "epoch": 0.8571428571428571,
1181
+ "grad_norm": 1.03605318069458,
1182
+ "learning_rate": 3.4286504241894283e-07,
1183
+ "logits/chosen": -0.9688073992729187,
1184
+ "logits/rejected": -1.2700920104980469,
1185
+ "logps/chosen": -38.00965118408203,
1186
+ "logps/rejected": -92.08466339111328,
1187
+ "loss": 0.1049,
1188
+ "rewards/accuracies": 1.0,
1189
+ "rewards/chosen": -0.01876715011894703,
1190
+ "rewards/margins": 3.16585636138916,
1191
+ "rewards/rejected": -3.1846237182617188,
1192
+ "step": 75
1193
+ },
1194
+ {
1195
+ "epoch": 0.8685714285714285,
1196
+ "grad_norm": 1.319770336151123,
1197
+ "learning_rate": 2.965923349633779e-07,
1198
+ "logits/chosen": -1.3658266067504883,
1199
+ "logits/rejected": -1.3608825206756592,
1200
+ "logps/chosen": -49.00103759765625,
1201
+ "logps/rejected": -117.49503326416016,
1202
+ "loss": 0.0818,
1203
+ "rewards/accuracies": 1.0,
1204
+ "rewards/chosen": -0.09428122639656067,
1205
+ "rewards/margins": 3.61112642288208,
1206
+ "rewards/rejected": -3.7054080963134766,
1207
+ "step": 76
1208
+ },
1209
+ {
1210
+ "epoch": 0.88,
1211
+ "grad_norm": 0.9297468662261963,
1212
+ "learning_rate": 2.53475987763295e-07,
1213
+ "logits/chosen": -1.0338634252548218,
1214
+ "logits/rejected": -1.1930313110351562,
1215
+ "logps/chosen": -67.0118179321289,
1216
+ "logps/rejected": -106.61903381347656,
1217
+ "loss": 0.0727,
1218
+ "rewards/accuracies": 1.0,
1219
+ "rewards/chosen": -0.13288229703903198,
1220
+ "rewards/margins": 3.487334728240967,
1221
+ "rewards/rejected": -3.6202168464660645,
1222
+ "step": 77
1223
+ },
1224
+ {
1225
+ "epoch": 0.8914285714285715,
1226
+ "grad_norm": 1.1066629886627197,
1227
+ "learning_rate": 2.135777645707318e-07,
1228
+ "logits/chosen": -1.384450078010559,
1229
+ "logits/rejected": -1.3552913665771484,
1230
+ "logps/chosen": -52.43301010131836,
1231
+ "logps/rejected": -101.87602996826172,
1232
+ "loss": 0.0989,
1233
+ "rewards/accuracies": 1.0,
1234
+ "rewards/chosen": 0.009377628564834595,
1235
+ "rewards/margins": 3.135222911834717,
1236
+ "rewards/rejected": -3.125845432281494,
1237
+ "step": 78
1238
+ },
1239
+ {
1240
+ "epoch": 0.9028571428571428,
1241
+ "grad_norm": 1.0631781816482544,
1242
+ "learning_rate": 1.7695481920608716e-07,
1243
+ "logits/chosen": -1.1844675540924072,
1244
+ "logits/rejected": -1.0223643779754639,
1245
+ "logps/chosen": -45.87510299682617,
1246
+ "logps/rejected": -102.84295654296875,
1247
+ "loss": 0.0862,
1248
+ "rewards/accuracies": 1.0,
1249
+ "rewards/chosen": -0.05180816724896431,
1250
+ "rewards/margins": 3.2761740684509277,
1251
+ "rewards/rejected": -3.3279824256896973,
1252
+ "step": 79
1253
+ },
1254
+ {
1255
+ "epoch": 0.9142857142857143,
1256
+ "grad_norm": 1.2742042541503906,
1257
+ "learning_rate": 1.4365961368581844e-07,
1258
+ "logits/chosen": -1.2797547578811646,
1259
+ "logits/rejected": -1.6902124881744385,
1260
+ "logps/chosen": -79.47929382324219,
1261
+ "logps/rejected": -78.93382263183594,
1262
+ "loss": 0.1025,
1263
+ "rewards/accuracies": 1.0,
1264
+ "rewards/chosen": -0.0567280538380146,
1265
+ "rewards/margins": 2.9206228256225586,
1266
+ "rewards/rejected": -2.977350950241089,
1267
+ "step": 80
1268
+ },
1269
+ {
1270
+ "epoch": 0.9257142857142857,
1271
+ "grad_norm": 0.8278792500495911,
1272
+ "learning_rate": 1.137398430711123e-07,
1273
+ "logits/chosen": -1.119363784790039,
1274
+ "logits/rejected": -0.9186141490936279,
1275
+ "logps/chosen": -29.899991989135742,
1276
+ "logps/rejected": -105.7519302368164,
1277
+ "loss": 0.0648,
1278
+ "rewards/accuracies": 1.0,
1279
+ "rewards/chosen": 0.031892240047454834,
1280
+ "rewards/margins": 3.5144004821777344,
1281
+ "rewards/rejected": -3.4825081825256348,
1282
+ "step": 81
1283
+ },
1284
+ {
1285
+ "epoch": 0.9371428571428572,
1286
+ "grad_norm": 1.0955795049667358,
1287
+ "learning_rate": 8.723836714516681e-08,
1288
+ "logits/chosen": -1.2281020879745483,
1289
+ "logits/rejected": -1.3817219734191895,
1290
+ "logps/chosen": -73.53196716308594,
1291
+ "logps/rejected": -103.11698913574219,
1292
+ "loss": 0.0811,
1293
+ "rewards/accuracies": 1.0,
1294
+ "rewards/chosen": -0.06516408920288086,
1295
+ "rewards/margins": 3.2024097442626953,
1296
+ "rewards/rejected": -3.267573833465576,
1297
+ "step": 82
1298
+ },
1299
+ {
1300
+ "epoch": 0.9485714285714286,
1301
+ "grad_norm": 0.6436601877212524,
1302
+ "learning_rate": 6.419314901696671e-08,
1303
+ "logits/chosen": -1.2053653001785278,
1304
+ "logits/rejected": -1.208804965019226,
1305
+ "logps/chosen": -28.06381607055664,
1306
+ "logps/rejected": -100.99942016601562,
1307
+ "loss": 0.0586,
1308
+ "rewards/accuracies": 1.0,
1309
+ "rewards/chosen": -0.027196241542696953,
1310
+ "rewards/margins": 3.633328437805176,
1311
+ "rewards/rejected": -3.660524845123291,
1312
+ "step": 83
1313
+ },
1314
+ {
1315
+ "epoch": 0.96,
1316
+ "grad_norm": 0.9888738393783569,
1317
+ "learning_rate": 4.4637200739493514e-08,
1318
+ "logits/chosen": -1.231987714767456,
1319
+ "logits/rejected": -1.143172025680542,
1320
+ "logps/chosen": -57.63927459716797,
1321
+ "logps/rejected": -96.07897186279297,
1322
+ "loss": 0.1077,
1323
+ "rewards/accuracies": 1.0,
1324
+ "rewards/chosen": -0.05573497712612152,
1325
+ "rewards/margins": 3.1897521018981934,
1326
+ "rewards/rejected": -3.2454872131347656,
1327
+ "step": 84
1328
+ },
1329
+ {
1330
+ "epoch": 0.9714285714285714,
1331
+ "grad_norm": 1.0415937900543213,
1332
+ "learning_rate": 2.8598536020278678e-08,
1333
+ "logits/chosen": -1.221508264541626,
1334
+ "logits/rejected": -1.4119690656661987,
1335
+ "logps/chosen": -48.45242691040039,
1336
+ "logps/rejected": -84.4826431274414,
1337
+ "loss": 0.0827,
1338
+ "rewards/accuracies": 1.0,
1339
+ "rewards/chosen": 0.04423363134264946,
1340
+ "rewards/margins": 3.218625545501709,
1341
+ "rewards/rejected": -3.174391984939575,
1342
+ "step": 85
1343
+ },
1344
+ {
1345
+ "epoch": 0.9828571428571429,
1346
+ "grad_norm": 1.0360701084136963,
1347
+ "learning_rate": 1.6100130092037704e-08,
1348
+ "logits/chosen": -1.3318215608596802,
1349
+ "logits/rejected": -1.6143568754196167,
1350
+ "logps/chosen": -45.959354400634766,
1351
+ "logps/rejected": -79.45930480957031,
1352
+ "loss": 0.0892,
1353
+ "rewards/accuracies": 1.0,
1354
+ "rewards/chosen": -0.08850360661745071,
1355
+ "rewards/margins": 2.9804043769836426,
1356
+ "rewards/rejected": -3.068908214569092,
1357
+ "step": 86
1358
+ },
1359
+ {
1360
+ "epoch": 0.9942857142857143,
1361
+ "grad_norm": 0.7161802053451538,
1362
+ "learning_rate": 7.159886800869875e-09,
1363
+ "logits/chosen": -1.1106700897216797,
1364
+ "logits/rejected": -0.9769763946533203,
1365
+ "logps/chosen": -85.0906982421875,
1366
+ "logps/rejected": -132.0802459716797,
1367
+ "loss": 0.0524,
1368
+ "rewards/accuracies": 1.0,
1369
+ "rewards/chosen": -0.0784958153963089,
1370
+ "rewards/margins": 4.037193298339844,
1371
+ "rewards/rejected": -4.115689277648926,
1372
+ "step": 87
1373
+ },
1374
+ {
1375
+ "epoch": 1.0,
1376
+ "grad_norm": 2.9429450035095215,
1377
+ "learning_rate": 1.7906129591713228e-09,
1378
+ "logits/chosen": -1.2418022155761719,
1379
+ "logits/rejected": -0.8798779249191284,
1380
+ "logps/chosen": -90.4301986694336,
1381
+ "logps/rejected": -115.04806518554688,
1382
+ "loss": 0.0987,
1383
+ "rewards/accuracies": 1.0,
1384
+ "rewards/chosen": -0.08904826641082764,
1385
+ "rewards/margins": 3.531545639038086,
1386
+ "rewards/rejected": -3.620594024658203,
1387
+ "step": 88
1388
+ },
1389
+ {
1390
+ "epoch": 1.0,
1391
+ "eval_logits/chosen": -1.1477130651474,
1392
+ "eval_logits/rejected": -1.244410514831543,
1393
+ "eval_logps/chosen": -91.70614624023438,
1394
+ "eval_logps/rejected": -111.82247161865234,
1395
+ "eval_loss": 0.1359921395778656,
1396
+ "eval_rewards/accuracies": 0.9700000286102295,
1397
+ "eval_rewards/chosen": -0.5955771207809448,
1398
+ "eval_rewards/margins": 2.9342737197875977,
1399
+ "eval_rewards/rejected": -3.529850959777832,
1400
+ "eval_runtime": 209.3361,
1401
+ "eval_samples_per_second": 0.955,
1402
+ "eval_steps_per_second": 0.955,
1403
+ "step": 88
1404
+ },
1405
+ {
1406
+ "epoch": 1.0,
1407
+ "step": 88,
1408
+ "total_flos": 0.0,
1409
+ "train_loss": 0.2132695221172815,
1410
+ "train_runtime": 4416.7921,
1411
+ "train_samples_per_second": 0.317,
1412
+ "train_steps_per_second": 0.02
1413
+ }
1414
+ ],
1415
+ "trial_params": null,
1416
+ "global_step": 88,
1417
+ "is_local_process_zero": true,
1418
+ "total_flos": 0.0,
1419
+ "num_train_epochs": 1,
1420
+ "epoch": 1.0,
1421
+ "best_metric": null,
1422
+ "trial_name": null
1423
+ }
vocab.json ADDED
The diff for this file is too large to render. See raw diff