bimabk commited on
Commit
eb8900c
·
verified ·
1 Parent(s): aab54a2

Upload task output 1

Browse files
Files changed (6) hide show
  1. config.json +8 -20
  2. generation_config.json +10 -0
  3. loss.txt +1 -1
  4. model.safetensors +2 -2
  5. trainer_state.json +368 -236
  6. training_args.bin +1 -1
config.json CHANGED
@@ -3,13 +3,13 @@
3
  "Qwen2ForCausalLM"
4
  ],
5
  "attention_dropout": 0.0,
6
- "bos_token_id": 151643,
7
  "dtype": "bfloat16",
8
  "eos_token_id": 151645,
9
  "hidden_act": "silu",
10
- "hidden_size": 2048,
11
  "initializer_range": 0.02,
12
- "intermediate_size": 11008,
13
  "layer_types": [
14
  "full_attention",
15
  "full_attention",
@@ -34,27 +34,15 @@
34
  "full_attention",
35
  "full_attention",
36
  "full_attention",
37
- "full_attention",
38
- "full_attention",
39
- "full_attention",
40
- "full_attention",
41
- "full_attention",
42
- "full_attention",
43
- "full_attention",
44
- "full_attention",
45
- "full_attention",
46
- "full_attention",
47
- "full_attention",
48
- "full_attention",
49
  "full_attention"
50
  ],
51
  "max_position_embeddings": 32768,
52
- "max_window_layers": 70,
53
  "model_type": "qwen2",
54
- "num_attention_heads": 16,
55
- "num_hidden_layers": 36,
56
  "num_key_value_heads": 2,
57
- "pad_token_id": null,
58
  "rms_norm_eps": 1e-06,
59
  "rope_parameters": {
60
  "rope_theta": 1000000.0,
@@ -63,7 +51,7 @@
63
  "sliding_window": null,
64
  "tie_word_embeddings": true,
65
  "transformers_version": "5.1.0",
66
- "use_cache": true,
67
  "use_sliding_window": false,
68
  "vocab_size": 151936
69
  }
 
3
  "Qwen2ForCausalLM"
4
  ],
5
  "attention_dropout": 0.0,
6
+ "bos_token_id": null,
7
  "dtype": "bfloat16",
8
  "eos_token_id": 151645,
9
  "hidden_act": "silu",
10
+ "hidden_size": 896,
11
  "initializer_range": 0.02,
12
+ "intermediate_size": 4864,
13
  "layer_types": [
14
  "full_attention",
15
  "full_attention",
 
34
  "full_attention",
35
  "full_attention",
36
  "full_attention",
 
 
 
 
 
 
 
 
 
 
 
 
37
  "full_attention"
38
  ],
39
  "max_position_embeddings": 32768,
40
+ "max_window_layers": 21,
41
  "model_type": "qwen2",
42
+ "num_attention_heads": 14,
43
+ "num_hidden_layers": 24,
44
  "num_key_value_heads": 2,
45
+ "pad_token_id": 151643,
46
  "rms_norm_eps": 1e-06,
47
  "rope_parameters": {
48
  "rope_theta": 1000000.0,
 
51
  "sliding_window": null,
52
  "tie_word_embeddings": true,
53
  "transformers_version": "5.1.0",
54
+ "use_cache": false,
55
  "use_sliding_window": false,
56
  "vocab_size": 151936
57
  }
generation_config.json CHANGED
@@ -1,3 +1,13 @@
1
  {
 
 
 
 
 
 
 
 
 
 
2
  "transformers_version": "5.1.0"
3
  }
 
1
  {
2
+ "do_sample": true,
3
+ "eos_token_id": [
4
+ 151645,
5
+ 151643
6
+ ],
7
+ "pad_token_id": 151643,
8
+ "repetition_penalty": 1.1,
9
+ "temperature": 0.7,
10
+ "top_k": 20,
11
+ "top_p": 0.8,
12
  "transformers_version": "5.1.0"
13
  }
loss.txt CHANGED
@@ -1 +1 @@
1
- 49,no_eval
 
1
+ 68,no_eval
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:84a818b6851ccc1ef74d75dd1041a284ff97e169342cff118f06248349f68f61
3
- size 6171927112
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6396161d7682c5b922070eaba3cbfd3497f329b60c83c004a56b1c82f0a44163
3
+ size 988097824
trainer_state.json CHANGED
@@ -2,314 +2,446 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.007350735073507351,
6
  "eval_steps": 500,
7
- "global_step": 49,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "clip_ratio/high_max": 0.012122603878378869,
14
- "clip_ratio/high_mean": 0.009002478327602148,
15
- "clip_ratio/low_mean": 0.009024427458643913,
16
- "clip_ratio/low_min": 0.00597147960215807,
17
- "clip_ratio/region_mean": 0.018026905506849288,
18
  "completions/clipped_ratio": 0.0,
19
- "completions/max_length": 374.2,
20
- "completions/max_terminated_length": 374.2,
21
- "completions/mean_length": 294.0400146484375,
22
- "completions/mean_terminated_length": 294.0400146484375,
23
- "completions/min_length": 201.8,
24
- "completions/min_terminated_length": 201.8,
25
- "entropy": 0.3647212088108063,
26
  "epoch": 0.00075007500750075,
27
- "frac_reward_zero_std": 0.4400000274181366,
28
- "grad_norm": 0.13166534900665283,
29
- "kl": 0.007049627602100372,
30
  "learning_rate": 1.137216e-06,
31
- "loss": 0.00026110392063856126,
32
- "num_tokens": 127464.0,
33
- "reward": 0.2516666889190674,
34
- "reward_std": 0.24371615052223206,
35
- "rewards/env_goofspiel_reward/mean": 0.25166667699813844,
36
- "rewards/env_goofspiel_reward/std": 0.3760793387889862,
37
- "sampling/importance_sampling_ratio/max": 2.2995895385742187,
38
- "sampling/importance_sampling_ratio/mean": 0.9868913888931274,
39
- "sampling/importance_sampling_ratio/min": 0.2817646384239197,
40
- "sampling/sampling_logp_difference/max": 1.188546347618103,
41
- "sampling/sampling_logp_difference/mean": 0.07895174026489257,
42
  "step": 5,
43
- "step_time": 5.119130537400087
44
  },
45
  {
46
- "clip_ratio/high_max": 0.03911839425563812,
47
- "clip_ratio/high_mean": 0.02565017491579056,
48
- "clip_ratio/low_mean": 0.023128375131636857,
49
- "clip_ratio/low_min": 0.014993287436664105,
50
- "clip_ratio/region_mean": 0.04877855032682419,
51
  "completions/clipped_ratio": 0.0,
52
- "completions/max_length": 373.8,
53
- "completions/max_terminated_length": 373.8,
54
- "completions/mean_length": 294.0533447265625,
55
- "completions/mean_terminated_length": 294.0533447265625,
56
- "completions/min_length": 206.8,
57
- "completions/min_terminated_length": 206.8,
58
- "entropy": 0.36778058409690856,
59
  "epoch": 0.0015001500150015,
60
- "frac_reward_zero_std": 0.5466666936874389,
61
- "grad_norm": 0.14173148572444916,
62
- "kl": 0.05584366247057915,
63
  "learning_rate": 2.5587359999999995e-06,
64
- "loss": 0.0008797919377684593,
65
- "num_tokens": 254821.0,
66
- "reward": 0.29593334794044496,
67
- "reward_std": 0.22636846899986268,
68
- "rewards/env_goofspiel_reward/mean": 0.295933336019516,
69
- "rewards/env_goofspiel_reward/std": 0.37524943351745604,
70
- "sampling/importance_sampling_ratio/max": 1.936799955368042,
71
- "sampling/importance_sampling_ratio/mean": 0.9827824354171752,
72
- "sampling/importance_sampling_ratio/min": 0.13101087883114815,
73
- "sampling/sampling_logp_difference/max": 1.8672266960144044,
74
- "sampling/sampling_logp_difference/mean": 0.0872830867767334,
75
  "step": 10,
76
- "step_time": 4.894469680600014
77
  },
78
  {
79
- "clip_ratio/high_max": 0.018904919549822808,
80
- "clip_ratio/high_mean": 0.009452459774911404,
81
- "clip_ratio/low_mean": 0.010854446236044169,
82
- "clip_ratio/low_min": 0.00317460335791111,
83
- "clip_ratio/region_mean": 0.020306906104087828,
84
  "completions/clipped_ratio": 0.0,
85
- "completions/max_length": 373.8,
86
- "completions/max_terminated_length": 373.8,
87
- "completions/mean_length": 289.2733520507812,
88
- "completions/mean_terminated_length": 289.2733520507812,
89
- "completions/min_length": 207.0,
90
- "completions/min_terminated_length": 207.0,
91
- "entropy": 0.3574877142906189,
92
  "epoch": 0.0022502250225022503,
93
- "frac_reward_zero_std": 0.5066666901111603,
94
- "grad_norm": 0.1312570422887802,
95
- "kl": 0.08231633007526398,
96
  "learning_rate": 3.9802559999999995e-06,
97
- "loss": 5.0917407497763635e-05,
98
- "num_tokens": 381014.0,
99
- "reward": 0.33580002784729,
100
- "reward_std": 0.249184450507164,
101
- "rewards/env_goofspiel_reward/mean": 0.3358000159263611,
102
- "rewards/env_goofspiel_reward/std": 0.3957887411117554,
103
- "sampling/importance_sampling_ratio/max": 2.0427069664001465,
104
- "sampling/importance_sampling_ratio/mean": 0.9270470976829529,
105
- "sampling/importance_sampling_ratio/min": 0.1582688070833683,
106
- "sampling/sampling_logp_difference/max": 2.064827084541321,
107
- "sampling/sampling_logp_difference/mean": 0.08485963344573974,
108
  "step": 15,
109
- "step_time": 4.857296707200021
110
  },
111
  {
112
- "clip_ratio/high_max": 0.009682540223002434,
113
- "clip_ratio/high_mean": 0.007896307110786437,
114
- "clip_ratio/low_mean": 0.014026808738708495,
115
- "clip_ratio/low_min": 0.006318408064544201,
116
- "clip_ratio/region_mean": 0.021923115849494933,
117
  "completions/clipped_ratio": 0.0,
118
- "completions/max_length": 373.4,
119
- "completions/max_terminated_length": 373.4,
120
- "completions/mean_length": 273.9466796875,
121
- "completions/mean_terminated_length": 273.9466796875,
122
- "completions/min_length": 194.6,
123
- "completions/min_terminated_length": 194.6,
124
- "entropy": 0.36010334491729734,
125
  "epoch": 0.003000300030003,
126
- "frac_reward_zero_std": 0.45333335399627683,
127
- "grad_norm": 0.08147107064723969,
128
- "kl": 0.4074278950691223,
129
  "learning_rate": 5.401775999999999e-06,
130
- "loss": -0.0003812873270362616,
131
- "num_tokens": 502616.0,
132
- "reward": 0.3597333669662476,
133
- "reward_std": 0.2605924427509308,
134
- "rewards/env_goofspiel_reward/mean": 0.3597333550453186,
135
- "rewards/env_goofspiel_reward/std": 0.41715014576911924,
136
- "sampling/importance_sampling_ratio/max": 2.339983344078064,
137
- "sampling/importance_sampling_ratio/mean": 0.977954626083374,
138
- "sampling/importance_sampling_ratio/min": 0.17428167462348937,
139
- "sampling/sampling_logp_difference/max": 2.17000892162323,
140
- "sampling/sampling_logp_difference/mean": 0.10334575623273849,
141
  "step": 20,
142
- "step_time": 4.810719416000029
143
  },
144
  {
145
- "clip_ratio/high_max": 0.00952540971338749,
146
- "clip_ratio/high_mean": 0.004762704856693745,
147
- "clip_ratio/low_mean": 0.012625571712851525,
148
- "clip_ratio/low_min": 0.009376526437699794,
149
- "clip_ratio/region_mean": 0.017388276383280755,
150
  "completions/clipped_ratio": 0.0,
151
- "completions/max_length": 373.8,
152
- "completions/max_terminated_length": 373.8,
153
- "completions/mean_length": 291.360009765625,
154
- "completions/mean_terminated_length": 291.360009765625,
155
  "completions/min_length": 212.0,
156
  "completions/min_terminated_length": 212.0,
157
- "entropy": 0.317078959941864,
158
  "epoch": 0.0037503750375037503,
159
- "frac_reward_zero_std": 0.45333335399627683,
160
- "grad_norm": 0.27843180298805237,
161
- "kl": 0.6531880825757981,
162
  "learning_rate": 6.8232959999999994e-06,
163
- "loss": -0.0005337921902537346,
164
- "num_tokens": 629159.0,
165
- "reward": 0.4559333860874176,
166
- "reward_std": 0.2489958882331848,
167
- "rewards/env_goofspiel_reward/mean": 0.4559333622455597,
168
- "rewards/env_goofspiel_reward/std": 0.37337183952331543,
169
- "sampling/importance_sampling_ratio/max": 2.3218794584274294,
170
- "sampling/importance_sampling_ratio/mean": 0.9727706193923951,
171
- "sampling/importance_sampling_ratio/min": 0.03638465753756463,
172
- "sampling/sampling_logp_difference/max": 2.5760634660720827,
173
- "sampling/sampling_logp_difference/mean": 0.11733063012361526,
174
  "step": 25,
175
- "step_time": 4.816599215199949
176
  },
177
  {
178
- "clip_ratio/high_max": 0.006507936865091324,
179
- "clip_ratio/high_mean": 0.003253968432545662,
180
- "clip_ratio/low_mean": 0.027271623164415358,
181
- "clip_ratio/low_min": 0.015977022424340247,
182
- "clip_ratio/region_mean": 0.03052559234201908,
183
  "completions/clipped_ratio": 0.0,
184
- "completions/max_length": 374.4,
185
- "completions/max_terminated_length": 374.4,
186
- "completions/mean_length": 289.25335083007815,
187
- "completions/mean_terminated_length": 289.25335083007815,
188
- "completions/min_length": 212.0,
189
- "completions/min_terminated_length": 212.0,
190
- "entropy": 0.33378886580467226,
191
  "epoch": 0.004500450045004501,
192
- "frac_reward_zero_std": 0.3600000202655792,
193
- "grad_norm": 0.1027369573712349,
194
- "kl": 1.2258114516735077,
195
  "learning_rate": 8.244816e-06,
196
- "loss": -0.0006984985433518886,
197
- "num_tokens": 754860.0,
198
- "reward": 0.4718667149543762,
199
- "reward_std": 0.3165953040122986,
200
- "rewards/env_goofspiel_reward/mean": 0.4718666851520538,
201
- "rewards/env_goofspiel_reward/std": 0.41961100697517395,
202
- "sampling/importance_sampling_ratio/max": 2.5107172966003417,
203
- "sampling/importance_sampling_ratio/mean": 0.9468889474868775,
204
- "sampling/importance_sampling_ratio/min": 0.049952364061027765,
205
- "sampling/sampling_logp_difference/max": 2.5360853910446166,
206
- "sampling/sampling_logp_difference/mean": 0.14082961529493332,
207
  "step": 30,
208
- "step_time": 4.918840783200176
209
  },
210
  {
211
- "clip_ratio/high_max": 0.012909946218132972,
212
- "clip_ratio/high_mean": 0.00809431727975607,
213
- "clip_ratio/low_mean": 0.009740076586604118,
214
- "clip_ratio/low_min": 0.006559139862656593,
215
- "clip_ratio/region_mean": 0.017834394052624703,
216
  "completions/clipped_ratio": 0.0,
217
- "completions/max_length": 374.0,
218
- "completions/max_terminated_length": 374.0,
219
- "completions/mean_length": 294.533349609375,
220
- "completions/mean_terminated_length": 294.533349609375,
221
  "completions/min_length": 212.0,
222
  "completions/min_terminated_length": 212.0,
223
- "entropy": 0.4855224847793579,
224
  "epoch": 0.005250525052505251,
225
- "frac_reward_zero_std": 0.5466666936874389,
226
- "grad_norm": 0.1376088261604309,
227
- "kl": 0.6020630955696106,
228
  "learning_rate": 9.666336e-06,
229
- "loss": -2.6161287678405643e-05,
230
- "num_tokens": 881908.0,
231
- "reward": 0.3080000221729279,
232
- "reward_std": 0.22061732709407805,
233
- "rewards/env_goofspiel_reward/mean": 0.30800001621246337,
234
- "rewards/env_goofspiel_reward/std": 0.4081439733505249,
235
- "sampling/importance_sampling_ratio/max": 2.0464017391204834,
236
- "sampling/importance_sampling_ratio/mean": 0.8832055687904358,
237
- "sampling/importance_sampling_ratio/min": 0.08903740048408508,
238
- "sampling/sampling_logp_difference/max": 1.4421878337860108,
239
- "sampling/sampling_logp_difference/mean": 0.1307734727859497,
240
  "step": 35,
241
- "step_time": 4.927365056799954
242
  },
243
  {
244
- "clip_ratio/high_max": 0.019359875097870828,
245
- "clip_ratio/high_mean": 0.012933905981481076,
246
- "clip_ratio/low_mean": 0.009454933740198613,
247
- "clip_ratio/low_min": 0.0032258063554763796,
248
- "clip_ratio/region_mean": 0.022388840094208717,
249
  "completions/clipped_ratio": 0.0,
250
- "completions/max_length": 365.4,
251
- "completions/max_terminated_length": 365.4,
252
- "completions/mean_length": 281.6333435058594,
253
- "completions/mean_terminated_length": 281.6333435058594,
254
  "completions/min_length": 212.0,
255
  "completions/min_terminated_length": 212.0,
256
- "entropy": 0.49551063776016235,
257
  "epoch": 0.006000600060006,
258
- "frac_reward_zero_std": 0.3866666853427887,
259
- "grad_norm": 0.08914674818515778,
260
- "kl": 0.8902900576591491,
261
  "learning_rate": 9.950639260700543e-06,
262
- "loss": 0.0002991344779729843,
263
- "num_tokens": 1005647.0,
264
- "reward": 0.359933340549469,
265
- "reward_std": 0.3053758591413498,
266
- "rewards/env_goofspiel_reward/mean": 0.3599333316087723,
267
- "rewards/env_goofspiel_reward/std": 0.40515289306640623,
268
- "sampling/importance_sampling_ratio/max": 2.4499823093414306,
269
- "sampling/importance_sampling_ratio/mean": 0.882733416557312,
270
- "sampling/importance_sampling_ratio/min": 0.11329675018787384,
271
- "sampling/sampling_logp_difference/max": 1.781545352935791,
272
- "sampling/sampling_logp_difference/mean": 0.14177367389202117,
273
  "step": 40,
274
- "step_time": 4.763557598199805
275
  },
276
  {
277
- "clip_ratio/high_max": 0.013015710189938546,
278
- "clip_ratio/high_mean": 0.008120758086442947,
279
- "clip_ratio/low_mean": 0.004791666753590107,
280
  "clip_ratio/low_min": 0.0,
281
- "clip_ratio/region_mean": 0.01291242502629757,
282
  "completions/clipped_ratio": 0.0,
283
  "completions/max_length": 374.0,
284
  "completions/max_terminated_length": 374.0,
285
- "completions/mean_length": 303.2200134277344,
286
- "completions/mean_terminated_length": 303.2200134277344,
287
  "completions/min_length": 212.0,
288
  "completions/min_terminated_length": 212.0,
289
- "entropy": 0.5108859002590179,
290
  "epoch": 0.0067506750675067504,
291
- "frac_reward_zero_std": 0.4266666889190674,
292
- "grad_norm": 0.058294642716646194,
293
- "kl": 0.37123287916183473,
294
  "learning_rate": 9.950636257297004e-06,
295
- "loss": 6.670470465905965e-05,
296
- "num_tokens": 1136078.0,
297
- "reward": 0.32793336510658266,
298
- "reward_std": 0.27162329852581024,
299
- "rewards/env_goofspiel_reward/mean": 0.3279333531856537,
300
- "rewards/env_goofspiel_reward/std": 0.40487490892410277,
301
- "sampling/importance_sampling_ratio/max": 2.1823894500732424,
302
- "sampling/importance_sampling_ratio/mean": 0.9206063866615295,
303
- "sampling/importance_sampling_ratio/min": 0.2219469040632248,
304
- "sampling/sampling_logp_difference/max": 1.034794545173645,
305
- "sampling/sampling_logp_difference/mean": 0.10992220342159272,
306
  "step": 45,
307
- "step_time": 4.865905853399909
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
308
  }
309
  ],
310
  "logging_steps": 5,
311
  "max_steps": 19998,
312
- "num_input_tokens_seen": 1238614,
313
  "num_train_epochs": 3,
314
  "save_steps": 500,
315
  "stateful_callbacks": {
@@ -325,7 +457,7 @@
325
  }
326
  },
327
  "total_flos": 0.0,
328
- "train_batch_size": 15,
329
  "trial_name": null,
330
  "trial_params": null
331
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.0102010201020102,
6
  "eval_steps": 500,
7
+ "global_step": 68,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "clip_ratio/high_max": 0.0,
14
+ "clip_ratio/high_mean": 0.0,
15
+ "clip_ratio/low_mean": 0.0,
16
+ "clip_ratio/low_min": 0.0,
17
+ "clip_ratio/region_mean": 0.0,
18
  "completions/clipped_ratio": 0.0,
19
+ "completions/max_length": 374.4,
20
+ "completions/max_terminated_length": 374.4,
21
+ "completions/mean_length": 291.50001220703126,
22
+ "completions/mean_terminated_length": 291.50001220703126,
23
+ "completions/min_length": 174.8,
24
+ "completions/min_terminated_length": 174.8,
25
+ "entropy": 0.737431001663208,
26
  "epoch": 0.00075007500750075,
27
+ "frac_reward_zero_std": 0.6533333778381347,
28
+ "grad_norm": 0.369140625,
29
+ "kl": 0.00885026976466179,
30
  "learning_rate": 1.137216e-06,
31
+ "loss": 0.00034544954542070627,
32
+ "num_tokens": 126703.0,
33
+ "reward": 0.0383333370089531,
34
+ "reward_std": 0.05835988484323025,
35
+ "rewards/env_goofspiel_reward/mean": 0.03833333514630795,
36
+ "rewards/env_goofspiel_reward/std": 0.15159520953893663,
37
+ "sampling/importance_sampling_ratio/max": 1.7607571125030517,
38
+ "sampling/importance_sampling_ratio/mean": 0.9916059970855713,
39
+ "sampling/importance_sampling_ratio/min": 0.5116463124752044,
40
+ "sampling/sampling_logp_difference/max": 0.6887424349784851,
41
+ "sampling/sampling_logp_difference/mean": 0.06558751240372658,
42
  "step": 5,
43
+ "step_time": 3.541577606199735
44
  },
45
  {
46
+ "clip_ratio/high_max": 0.0,
47
+ "clip_ratio/high_mean": 0.0,
48
+ "clip_ratio/low_mean": 0.0,
49
+ "clip_ratio/low_min": 0.0,
50
+ "clip_ratio/region_mean": 0.0,
51
  "completions/clipped_ratio": 0.0,
52
+ "completions/max_length": 373.6,
53
+ "completions/max_terminated_length": 373.6,
54
+ "completions/mean_length": 292.0866760253906,
55
+ "completions/mean_terminated_length": 292.0866760253906,
56
+ "completions/min_length": 179.8,
57
+ "completions/min_terminated_length": 179.8,
58
+ "entropy": 0.7154561956723531,
59
  "epoch": 0.0015001500150015,
60
+ "frac_reward_zero_std": 0.6666666865348816,
61
+ "grad_norm": 0.462890625,
62
+ "kl": 0.009678552253171801,
63
  "learning_rate": 2.5587359999999995e-06,
64
+ "loss": -3.925009514205158e-05,
65
+ "num_tokens": 254525.0,
66
+ "reward": 0.03886667159385979,
67
+ "reward_std": 0.05817132312804461,
68
+ "rewards/env_goofspiel_reward/mean": 0.03886666861362755,
69
+ "rewards/env_goofspiel_reward/std": 0.14201362472958862,
70
+ "sampling/importance_sampling_ratio/max": 1.9776098012924195,
71
+ "sampling/importance_sampling_ratio/mean": 1.0280600190162659,
72
+ "sampling/importance_sampling_ratio/min": 0.4622887670993805,
73
+ "sampling/sampling_logp_difference/max": 0.8463176250457763,
74
+ "sampling/sampling_logp_difference/mean": 0.06613281443715095,
75
  "step": 10,
76
+ "step_time": 3.1668822380001074
77
  },
78
  {
79
+ "clip_ratio/high_max": 0.0,
80
+ "clip_ratio/high_mean": 0.0,
81
+ "clip_ratio/low_mean": 0.0,
82
+ "clip_ratio/low_min": 0.0,
83
+ "clip_ratio/region_mean": 0.0,
84
  "completions/clipped_ratio": 0.0,
85
+ "completions/max_length": 373.6,
86
+ "completions/max_terminated_length": 373.6,
87
+ "completions/mean_length": 288.72001953125,
88
+ "completions/mean_terminated_length": 288.72001953125,
89
+ "completions/min_length": 187.2,
90
+ "completions/min_terminated_length": 187.2,
91
+ "entropy": 0.6402347763379415,
92
  "epoch": 0.0022502250225022503,
93
+ "frac_reward_zero_std": 0.8000000476837158,
94
+ "grad_norm": 0.412109375,
95
+ "kl": 0.00951577623685201,
96
  "learning_rate": 3.9802559999999995e-06,
97
+ "loss": 0.00047838701866567137,
98
+ "num_tokens": 380635.0,
99
+ "reward": 0.07146667279303073,
100
+ "reward_std": 0.09088679552078247,
101
+ "rewards/env_goofspiel_reward/mean": 0.07146666683256626,
102
+ "rewards/env_goofspiel_reward/std": 0.22424434274435043,
103
+ "sampling/importance_sampling_ratio/max": 1.5242333889007569,
104
+ "sampling/importance_sampling_ratio/mean": 0.9860278725624084,
105
+ "sampling/importance_sampling_ratio/min": 0.5668014168739319,
106
+ "sampling/sampling_logp_difference/max": 0.5752804994583129,
107
+ "sampling/sampling_logp_difference/mean": 0.05473804771900177,
108
  "step": 15,
109
+ "step_time": 3.1726541418000123
110
  },
111
  {
112
+ "clip_ratio/high_max": 0.0,
113
+ "clip_ratio/high_mean": 0.0,
114
+ "clip_ratio/low_mean": 0.0,
115
+ "clip_ratio/low_min": 0.0,
116
+ "clip_ratio/region_mean": 0.0,
117
  "completions/clipped_ratio": 0.0,
118
+ "completions/max_length": 373.2,
119
+ "completions/max_terminated_length": 373.2,
120
+ "completions/mean_length": 273.82001037597655,
121
+ "completions/mean_terminated_length": 273.82001037597655,
122
+ "completions/min_length": 200.2,
123
+ "completions/min_terminated_length": 200.2,
124
+ "entropy": 0.5869409064451854,
125
  "epoch": 0.003000300030003,
126
+ "frac_reward_zero_std": 0.7600000500679016,
127
+ "grad_norm": 0.158203125,
128
+ "kl": 0.029618356159577766,
129
  "learning_rate": 5.401775999999999e-06,
130
+ "loss": 0.00020813762675970794,
131
+ "num_tokens": 501743.0,
132
+ "reward": 0.06360000669956208,
133
+ "reward_std": 0.07976165302097797,
134
+ "rewards/env_goofspiel_reward/mean": 0.06360000558197498,
135
+ "rewards/env_goofspiel_reward/std": 0.20161283165216445,
136
+ "sampling/importance_sampling_ratio/max": 1.7165520668029786,
137
+ "sampling/importance_sampling_ratio/mean": 0.9985299944877625,
138
+ "sampling/importance_sampling_ratio/min": 0.6464852690696716,
139
+ "sampling/sampling_logp_difference/max": 0.6010382175445557,
140
+ "sampling/sampling_logp_difference/mean": 0.05117494091391563,
141
  "step": 20,
142
+ "step_time": 3.1184157538001274
143
  },
144
  {
145
+ "clip_ratio/high_max": 0.0,
146
+ "clip_ratio/high_mean": 0.0,
147
+ "clip_ratio/low_mean": 0.0,
148
+ "clip_ratio/low_min": 0.0,
149
+ "clip_ratio/region_mean": 0.0,
150
  "completions/clipped_ratio": 0.0,
151
+ "completions/max_length": 374.2,
152
+ "completions/max_terminated_length": 374.2,
153
+ "completions/mean_length": 291.16668090820315,
154
+ "completions/mean_terminated_length": 291.16668090820315,
155
  "completions/min_length": 212.0,
156
  "completions/min_terminated_length": 212.0,
157
+ "entropy": 0.5825250327587128,
158
  "epoch": 0.0037503750375037503,
159
+ "frac_reward_zero_std": 0.8133333921432495,
160
+ "grad_norm": 0.30859375,
161
+ "kl": 0.03789825042088826,
162
  "learning_rate": 6.8232959999999994e-06,
163
+ "loss": -5.795806646347046e-05,
164
+ "num_tokens": 629207.0,
165
+ "reward": 0.05593333579599857,
166
+ "reward_std": 0.0791016798466444,
167
+ "rewards/env_goofspiel_reward/mean": 0.055933335050940516,
168
+ "rewards/env_goofspiel_reward/std": 0.16461323350667953,
169
+ "sampling/importance_sampling_ratio/max": 1.6597614526748656,
170
+ "sampling/importance_sampling_ratio/mean": 0.9899526715278626,
171
+ "sampling/importance_sampling_ratio/min": 0.5461978197097779,
172
+ "sampling/sampling_logp_difference/max": 0.5474630713462829,
173
+ "sampling/sampling_logp_difference/mean": 0.056329603493213656,
174
  "step": 25,
175
+ "step_time": 3.1455567411999255
176
  },
177
  {
178
+ "clip_ratio/high_max": 0.0,
179
+ "clip_ratio/high_mean": 0.0,
180
+ "clip_ratio/low_mean": 0.0,
181
+ "clip_ratio/low_min": 0.0,
182
+ "clip_ratio/region_mean": 0.0,
183
  "completions/clipped_ratio": 0.0,
184
+ "completions/max_length": 373.8,
185
+ "completions/max_terminated_length": 373.8,
186
+ "completions/mean_length": 288.2733459472656,
187
+ "completions/mean_terminated_length": 288.2733459472656,
188
+ "completions/min_length": 205.4,
189
+ "completions/min_terminated_length": 205.4,
190
+ "entropy": 0.6367802540461223,
191
  "epoch": 0.004500450045004501,
192
+ "frac_reward_zero_std": 0.8133333921432495,
193
+ "grad_norm": 0.3203125,
194
+ "kl": 0.15099084513882796,
195
  "learning_rate": 8.244816e-06,
196
+ "loss": 2.9896479099988936e-05,
197
+ "num_tokens": 755141.0,
198
+ "reward": 0.04773333668708801,
199
+ "reward_std": 0.056945668533444405,
200
+ "rewards/env_goofspiel_reward/mean": 0.04773333407938481,
201
+ "rewards/env_goofspiel_reward/std": 0.1535952940583229,
202
+ "sampling/importance_sampling_ratio/max": 1.4472879409790038,
203
+ "sampling/importance_sampling_ratio/mean": 1.000359261035919,
204
+ "sampling/importance_sampling_ratio/min": 0.6299581527709961,
205
+ "sampling/sampling_logp_difference/max": 0.49155421257019044,
206
+ "sampling/sampling_logp_difference/mean": 0.04638729840517044,
207
  "step": 30,
208
+ "step_time": 3.104708982399825
209
  },
210
  {
211
+ "clip_ratio/high_max": 0.0,
212
+ "clip_ratio/high_mean": 0.0,
213
+ "clip_ratio/low_mean": 0.0,
214
+ "clip_ratio/low_min": 0.0,
215
+ "clip_ratio/region_mean": 0.0,
216
  "completions/clipped_ratio": 0.0,
217
+ "completions/max_length": 373.4,
218
+ "completions/max_terminated_length": 373.4,
219
+ "completions/mean_length": 294.12001953125,
220
+ "completions/mean_terminated_length": 294.12001953125,
221
  "completions/min_length": 212.0,
222
  "completions/min_terminated_length": 212.0,
223
+ "entropy": 0.6307838877042135,
224
  "epoch": 0.005250525052505251,
225
+ "frac_reward_zero_std": 0.8133333921432495,
226
+ "grad_norm": 0.2041015625,
227
+ "kl": 0.21180881708860397,
228
  "learning_rate": 9.666336e-06,
229
+ "loss": 0.0003116762964054942,
230
+ "num_tokens": 881937.0,
231
+ "reward": 0.04366667197318748,
232
+ "reward_std": 0.0626968042459339,
233
+ "rewards/env_goofspiel_reward/mean": 0.04366666899295524,
234
+ "rewards/env_goofspiel_reward/std": 0.14476882207673042,
235
+ "sampling/importance_sampling_ratio/max": 1.540164875984192,
236
+ "sampling/importance_sampling_ratio/mean": 1.007632350921631,
237
+ "sampling/importance_sampling_ratio/min": 0.6116935849189759,
238
+ "sampling/sampling_logp_difference/max": 0.5826021313667298,
239
+ "sampling/sampling_logp_difference/mean": 0.054141230136156085,
240
  "step": 35,
241
+ "step_time": 3.152498085000025
242
  },
243
  {
244
+ "clip_ratio/high_max": 0.0,
245
+ "clip_ratio/high_mean": 0.0,
246
+ "clip_ratio/low_mean": 0.0,
247
+ "clip_ratio/low_min": 0.0,
248
+ "clip_ratio/region_mean": 0.0,
249
  "completions/clipped_ratio": 0.0,
250
+ "completions/max_length": 365.8,
251
+ "completions/max_terminated_length": 365.8,
252
+ "completions/mean_length": 281.62001953125,
253
+ "completions/mean_terminated_length": 281.62001953125,
254
  "completions/min_length": 212.0,
255
  "completions/min_terminated_length": 212.0,
256
+ "entropy": 0.553737320502599,
257
  "epoch": 0.006000600060006,
258
+ "frac_reward_zero_std": 0.8266667246818542,
259
+ "grad_norm": 0.0888671875,
260
+ "kl": 0.5656270523866017,
261
  "learning_rate": 9.950639260700543e-06,
262
+ "loss": 0.00017667778301984073,
263
+ "num_tokens": 1005294.0,
264
+ "reward": 0.056000004336237905,
265
+ "reward_std": 0.07919596247375012,
266
+ "rewards/env_goofspiel_reward/mean": 0.05600000284612179,
267
+ "rewards/env_goofspiel_reward/std": 0.18038542717695236,
268
+ "sampling/importance_sampling_ratio/max": 1.5142346620559692,
269
+ "sampling/importance_sampling_ratio/mean": 0.9889694690704346,
270
+ "sampling/importance_sampling_ratio/min": 0.6695701956748963,
271
+ "sampling/sampling_logp_difference/max": 0.45929052233695983,
272
+ "sampling/sampling_logp_difference/mean": 0.05039779171347618,
273
  "step": 40,
274
+ "step_time": 3.061584199799836
275
  },
276
  {
277
+ "clip_ratio/high_max": 0.0,
278
+ "clip_ratio/high_mean": 0.0,
279
+ "clip_ratio/low_mean": 0.0,
280
  "clip_ratio/low_min": 0.0,
281
+ "clip_ratio/region_mean": 0.0,
282
  "completions/clipped_ratio": 0.0,
283
  "completions/max_length": 374.0,
284
  "completions/max_terminated_length": 374.0,
285
+ "completions/mean_length": 303.58001708984375,
286
+ "completions/mean_terminated_length": 303.58001708984375,
287
  "completions/min_length": 212.0,
288
  "completions/min_terminated_length": 212.0,
289
+ "entropy": 0.48466593225797017,
290
  "epoch": 0.0067506750675067504,
291
+ "frac_reward_zero_std": 0.8266667246818542,
292
+ "grad_norm": 0.1748046875,
293
+ "kl": 1.0889011422793071,
294
  "learning_rate": 9.950636257297004e-06,
295
+ "loss": 0.00040990984998643396,
296
+ "num_tokens": 1135969.0,
297
+ "reward": 0.04786667115986347,
298
+ "reward_std": 0.06807081587612629,
299
+ "rewards/env_goofspiel_reward/mean": 0.047866668179631235,
300
+ "rewards/env_goofspiel_reward/std": 0.1721431568264961,
301
+ "sampling/importance_sampling_ratio/max": 1.4374094486236573,
302
+ "sampling/importance_sampling_ratio/mean": 0.9694242954254151,
303
+ "sampling/importance_sampling_ratio/min": 0.6029698491096497,
304
+ "sampling/sampling_logp_difference/max": 0.5160395622253418,
305
+ "sampling/sampling_logp_difference/mean": 0.04300674088299274,
306
  "step": 45,
307
+ "step_time": 3.19344236120005
308
+ },
309
+ {
310
+ "clip_ratio/high_max": 0.0,
311
+ "clip_ratio/high_mean": 0.0,
312
+ "clip_ratio/low_mean": 0.0,
313
+ "clip_ratio/low_min": 0.0,
314
+ "clip_ratio/region_mean": 0.0,
315
+ "completions/clipped_ratio": 0.0,
316
+ "completions/max_length": 375.6,
317
+ "completions/max_terminated_length": 375.6,
318
+ "completions/mean_length": 296.2133483886719,
319
+ "completions/mean_terminated_length": 296.2133483886719,
320
+ "completions/min_length": 212.0,
321
+ "completions/min_terminated_length": 212.0,
322
+ "entropy": 0.3623567740122477,
323
+ "epoch": 0.007500750075007501,
324
+ "frac_reward_zero_std": 0.8800000429153443,
325
+ "grad_norm": 0.134765625,
326
+ "kl": 0.9536839803059896,
327
+ "learning_rate": 9.950630943585028e-06,
328
+ "loss": 0.00046116397716104983,
329
+ "num_tokens": 1262891.0,
330
+ "reward": 0.040000003576278684,
331
+ "reward_std": 0.05656854659318924,
332
+ "rewards/env_goofspiel_reward/mean": 0.04000000208616257,
333
+ "rewards/env_goofspiel_reward/std": 0.13237088024616242,
334
+ "sampling/importance_sampling_ratio/max": 1.4614337921142577,
335
+ "sampling/importance_sampling_ratio/mean": 0.9917921781539917,
336
+ "sampling/importance_sampling_ratio/min": 0.7945461988449096,
337
+ "sampling/sampling_logp_difference/max": 0.34459147453308103,
338
+ "sampling/sampling_logp_difference/mean": 0.023883017525076867,
339
+ "step": 50,
340
+ "step_time": 3.080125956599841
341
+ },
342
+ {
343
+ "clip_ratio/high_max": 0.0,
344
+ "clip_ratio/high_mean": 0.0,
345
+ "clip_ratio/low_mean": 0.0,
346
+ "clip_ratio/low_min": 0.0,
347
+ "clip_ratio/region_mean": 0.0,
348
+ "completions/clipped_ratio": 0.0,
349
+ "completions/max_length": 373.8,
350
+ "completions/max_terminated_length": 373.8,
351
+ "completions/mean_length": 297.3133483886719,
352
+ "completions/mean_terminated_length": 297.3133483886719,
353
+ "completions/min_length": 212.0,
354
+ "completions/min_terminated_length": 212.0,
355
+ "entropy": 0.412084698677063,
356
+ "epoch": 0.00825082508250825,
357
+ "frac_reward_zero_std": 0.840000057220459,
358
+ "grad_norm": 0.11279296875,
359
+ "kl": 0.8989204486211141,
360
+ "learning_rate": 9.950623319567901e-06,
361
+ "loss": 0.00017252418911084533,
362
+ "num_tokens": 1391274.0,
363
+ "reward": 0.059933338314294815,
364
+ "reward_std": 0.07363338991999627,
365
+ "rewards/env_goofspiel_reward/mean": 0.059933335334062574,
366
+ "rewards/env_goofspiel_reward/std": 0.19352754354476928,
367
+ "sampling/importance_sampling_ratio/max": 1.510833191871643,
368
+ "sampling/importance_sampling_ratio/mean": 1.0025275230407715,
369
+ "sampling/importance_sampling_ratio/min": 0.7753824949264526,
370
+ "sampling/sampling_logp_difference/max": 0.37447161674499513,
371
+ "sampling/sampling_logp_difference/mean": 0.025511124357581138,
372
+ "step": 55,
373
+ "step_time": 3.1612697836000736
374
+ },
375
+ {
376
+ "clip_ratio/high_max": 0.0,
377
+ "clip_ratio/high_mean": 0.0,
378
+ "clip_ratio/low_mean": 0.0,
379
+ "clip_ratio/low_min": 0.0,
380
+ "clip_ratio/region_mean": 0.0,
381
+ "completions/clipped_ratio": 0.0,
382
+ "completions/max_length": 374.0,
383
+ "completions/max_terminated_length": 374.0,
384
+ "completions/mean_length": 293.233349609375,
385
+ "completions/mean_terminated_length": 293.233349609375,
386
+ "completions/min_length": 212.0,
387
+ "completions/min_terminated_length": 212.0,
388
+ "entropy": 0.3592885712782542,
389
+ "epoch": 0.009000900090009001,
390
+ "frac_reward_zero_std": 0.8533333778381348,
391
+ "grad_norm": 0.0164794921875,
392
+ "kl": 0.9290923396746318,
393
+ "learning_rate": 9.950613385250344e-06,
394
+ "loss": 0.00017089147586375476,
395
+ "num_tokens": 1517875.0,
396
+ "reward": 0.06400000602006913,
397
+ "reward_std": 0.07919596470892429,
398
+ "rewards/env_goofspiel_reward/mean": 0.06400000229477883,
399
+ "rewards/env_goofspiel_reward/std": 0.192934051156044,
400
+ "sampling/importance_sampling_ratio/max": 1.3080760478973388,
401
+ "sampling/importance_sampling_ratio/mean": 1.00157231092453,
402
+ "sampling/importance_sampling_ratio/min": 0.809451448917389,
403
+ "sampling/sampling_logp_difference/max": 0.3210816144943237,
404
+ "sampling/sampling_logp_difference/mean": 0.021189583651721477,
405
+ "step": 60,
406
+ "step_time": 3.1453409107998596
407
+ },
408
+ {
409
+ "clip_ratio/high_max": 0.0,
410
+ "clip_ratio/high_mean": 0.0,
411
+ "clip_ratio/low_mean": 0.0,
412
+ "clip_ratio/low_min": 0.0,
413
+ "clip_ratio/region_mean": 0.0,
414
+ "completions/clipped_ratio": 0.0,
415
+ "completions/max_length": 374.0,
416
+ "completions/max_terminated_length": 374.0,
417
+ "completions/mean_length": 280.706689453125,
418
+ "completions/mean_terminated_length": 280.706689453125,
419
+ "completions/min_length": 212.0,
420
+ "completions/min_terminated_length": 212.0,
421
+ "entropy": 0.46913262009620665,
422
+ "epoch": 0.00975097509750975,
423
+ "frac_reward_zero_std": 0.840000057220459,
424
+ "grad_norm": 0.04541015625,
425
+ "kl": 1.9159570078055064,
426
+ "learning_rate": 9.95060114063851e-06,
427
+ "loss": 0.00043630152940750123,
428
+ "num_tokens": 1640903.0,
429
+ "reward": 0.07593334019184113,
430
+ "reward_std": 0.07363339141011238,
431
+ "rewards/env_goofspiel_reward/mean": 0.07593333572149277,
432
+ "rewards/env_goofspiel_reward/std": 0.22238647043704987,
433
+ "sampling/importance_sampling_ratio/max": 1.42401442527771,
434
+ "sampling/importance_sampling_ratio/mean": 1.001141333580017,
435
+ "sampling/importance_sampling_ratio/min": 0.7154132127761841,
436
+ "sampling/sampling_logp_difference/max": 0.3389713287353516,
437
+ "sampling/sampling_logp_difference/mean": 0.026769372820854186,
438
+ "step": 65,
439
+ "step_time": 3.0763218426000094
440
  }
441
  ],
442
  "logging_steps": 5,
443
  "max_steps": 19998,
444
+ "num_input_tokens_seen": 1713916,
445
  "num_train_epochs": 3,
446
  "save_steps": 500,
447
  "stateful_callbacks": {
 
457
  }
458
  },
459
  "total_flos": 0.0,
460
+ "train_batch_size": 10,
461
  "trial_name": null,
462
  "trial_params": null
463
  }
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ac9929cb2fba579bddba18a776b644d1599eb6965f5f63006443dc3723b476a2
3
  size 7185
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3300a89e75ebdeb9256a0a6e1d02dfcc2078fc90cd06fa1740dbf57e59261452
3
  size 7185