T0KII commited on
Commit
8688f1d
·
verified ·
1 Parent(s): 27f4368

Training in progress, step 23412, checkpoint

Browse files
checkpoint-23412/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_cross_attention": false,
3
+ "architectures": [
4
+ "BertForMaskedLM"
5
+ ],
6
+ "attention_probs_dropout_prob": 0.1,
7
+ "bos_token_id": null,
8
+ "classifier_dropout": null,
9
+ "directionality": "bidi",
10
+ "dtype": "float32",
11
+ "eos_token_id": null,
12
+ "gradient_checkpointing": false,
13
+ "hidden_act": "gelu",
14
+ "hidden_dropout_prob": 0.1,
15
+ "hidden_size": 768,
16
+ "initializer_range": 0.02,
17
+ "intermediate_size": 3072,
18
+ "is_decoder": false,
19
+ "layer_norm_eps": 1e-12,
20
+ "max_position_embeddings": 512,
21
+ "model_type": "bert",
22
+ "num_attention_heads": 12,
23
+ "num_hidden_layers": 12,
24
+ "pad_token_id": 0,
25
+ "pooler_fc_size": 768,
26
+ "pooler_num_attention_heads": 12,
27
+ "pooler_num_fc_layers": 3,
28
+ "pooler_size_per_head": 128,
29
+ "pooler_type": "first_token_transform",
30
+ "position_embedding_type": "absolute",
31
+ "tie_word_embeddings": false,
32
+ "transformers_version": "5.0.0",
33
+ "type_vocab_size": 2,
34
+ "use_cache": false,
35
+ "vocab_size": 100000
36
+ }
checkpoint-23412/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:84145ee3498ee4b7bd97d366f4d52d04330f2568abc629f508b961b321b39e70
3
+ size 959395416
checkpoint-23412/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3e6d47b3619e9b45ec256e4abcd02d18cfd13ffa790253eae69efd247204caee
3
+ size 1918914187
checkpoint-23412/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0ddfee62ce9ae994f13c8ead792293700121bf1c5fbadcae43fc68cfa3edaef0
3
+ size 14645
checkpoint-23412/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:71918224aa7e0fc4df1fecb923e3fc5a1abd7be7aa7fd28ca74d08a72a803333
3
+ size 1383
checkpoint-23412/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0d00e39ce01908705dd3b62a5db56b6035c6c41934943fbf24d0739f7a64f195
3
+ size 1465
checkpoint-23412/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-23412/tokenizer_config.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "cls_token": "[CLS]",
4
+ "do_basic_tokenize": true,
5
+ "do_lower_case": true,
6
+ "is_local": false,
7
+ "mask_token": "[MASK]",
8
+ "model_max_length": 1000000000000000019884624838656,
9
+ "never_split": null,
10
+ "pad_token": "[PAD]",
11
+ "sep_token": "[SEP]",
12
+ "strip_accents": null,
13
+ "tokenize_chinese_chars": true,
14
+ "tokenizer_class": "BertTokenizer",
15
+ "unk_token": "[UNK]"
16
+ }
checkpoint-23412/trainer_state.json ADDED
@@ -0,0 +1,1062 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 22500,
3
+ "best_metric": 1.4907582998275757,
4
+ "best_model_checkpoint": "/kaggle/working/MASRIBERTV4_ckpts/checkpoint-22500",
5
+ "epoch": 2.0,
6
+ "eval_steps": 500,
7
+ "global_step": 23412,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.02135748152577848,
14
+ "grad_norm": 112.14698028564453,
15
+ "learning_rate": 1.245e-06,
16
+ "loss": 58.53020703125,
17
+ "step": 250
18
+ },
19
+ {
20
+ "epoch": 0.04271496305155696,
21
+ "grad_norm": 94.12735748291016,
22
+ "learning_rate": 2.4950000000000003e-06,
23
+ "loss": 49.33264453125,
24
+ "step": 500
25
+ },
26
+ {
27
+ "epoch": 0.04271496305155696,
28
+ "eval_loss": 5.498984336853027,
29
+ "eval_runtime": 1927.5234,
30
+ "eval_samples_per_second": 40.952,
31
+ "eval_steps_per_second": 2.56,
32
+ "step": 500
33
+ },
34
+ {
35
+ "epoch": 0.06407244457733544,
36
+ "grad_norm": 90.2774658203125,
37
+ "learning_rate": 3.7449999999999997e-06,
38
+ "loss": 44.8349609375,
39
+ "step": 750
40
+ },
41
+ {
42
+ "epoch": 0.08542992610311392,
43
+ "grad_norm": 95.37772369384766,
44
+ "learning_rate": 4.9950000000000005e-06,
45
+ "loss": 42.08175390625,
46
+ "step": 1000
47
+ },
48
+ {
49
+ "epoch": 0.08542992610311392,
50
+ "eval_loss": 4.845311641693115,
51
+ "eval_runtime": 1929.6401,
52
+ "eval_samples_per_second": 40.907,
53
+ "eval_steps_per_second": 2.557,
54
+ "step": 1000
55
+ },
56
+ {
57
+ "epoch": 0.1067874076288924,
58
+ "grad_norm": 86.53277587890625,
59
+ "learning_rate": 6.245e-06,
60
+ "loss": 40.29465234375,
61
+ "step": 1250
62
+ },
63
+ {
64
+ "epoch": 0.12814488915467087,
65
+ "grad_norm": 93.83633422851562,
66
+ "learning_rate": 7.495e-06,
67
+ "loss": 38.960453125,
68
+ "step": 1500
69
+ },
70
+ {
71
+ "epoch": 0.12814488915467087,
72
+ "eval_loss": 4.519171714782715,
73
+ "eval_runtime": 1928.7805,
74
+ "eval_samples_per_second": 40.925,
75
+ "eval_steps_per_second": 2.558,
76
+ "step": 1500
77
+ },
78
+ {
79
+ "epoch": 0.14950237068044936,
80
+ "grad_norm": 81.17627716064453,
81
+ "learning_rate": 8.745e-06,
82
+ "loss": 37.7989140625,
83
+ "step": 1750
84
+ },
85
+ {
86
+ "epoch": 0.17085985220622785,
87
+ "grad_norm": 84.88935089111328,
88
+ "learning_rate": 9.995e-06,
89
+ "loss": 36.94516015625,
90
+ "step": 2000
91
+ },
92
+ {
93
+ "epoch": 0.17085985220622785,
94
+ "eval_loss": 4.303403854370117,
95
+ "eval_runtime": 1928.1902,
96
+ "eval_samples_per_second": 40.938,
97
+ "eval_steps_per_second": 2.559,
98
+ "step": 2000
99
+ },
100
+ {
101
+ "epoch": 0.19221733373200633,
102
+ "grad_norm": 79.1358413696289,
103
+ "learning_rate": 1.1245e-05,
104
+ "loss": 36.1753828125,
105
+ "step": 2250
106
+ },
107
+ {
108
+ "epoch": 0.2135748152577848,
109
+ "grad_norm": 85.23380279541016,
110
+ "learning_rate": 1.2495000000000001e-05,
111
+ "loss": 35.4720703125,
112
+ "step": 2500
113
+ },
114
+ {
115
+ "epoch": 0.2135748152577848,
116
+ "eval_loss": 4.146875381469727,
117
+ "eval_runtime": 1927.7742,
118
+ "eval_samples_per_second": 40.947,
119
+ "eval_steps_per_second": 2.559,
120
+ "step": 2500
121
+ },
122
+ {
123
+ "epoch": 0.23493229678356328,
124
+ "grad_norm": 40.744110107421875,
125
+ "learning_rate": 1.3725000000000002e-05,
126
+ "loss": 17.465578125,
127
+ "step": 2750
128
+ },
129
+ {
130
+ "epoch": 0.25628977830934174,
131
+ "grad_norm": 41.063385009765625,
132
+ "learning_rate": 1.4975e-05,
133
+ "loss": 17.180029296875,
134
+ "step": 3000
135
+ },
136
+ {
137
+ "epoch": 0.25628977830934174,
138
+ "eval_loss": 2.0153398513793945,
139
+ "eval_runtime": 791.0335,
140
+ "eval_samples_per_second": 99.788,
141
+ "eval_steps_per_second": 12.474,
142
+ "step": 3000
143
+ },
144
+ {
145
+ "epoch": 0.27764725983512023,
146
+ "grad_norm": 43.8082275390625,
147
+ "learning_rate": 1.6225e-05,
148
+ "loss": 16.96137890625,
149
+ "step": 3250
150
+ },
151
+ {
152
+ "epoch": 0.2990047413608987,
153
+ "grad_norm": 41.902591705322266,
154
+ "learning_rate": 1.7475e-05,
155
+ "loss": 16.6866015625,
156
+ "step": 3500
157
+ },
158
+ {
159
+ "epoch": 0.2990047413608987,
160
+ "eval_loss": 1.964239239692688,
161
+ "eval_runtime": 796.0599,
162
+ "eval_samples_per_second": 99.158,
163
+ "eval_steps_per_second": 12.395,
164
+ "step": 3500
165
+ },
166
+ {
167
+ "epoch": 0.3203622228866772,
168
+ "grad_norm": 38.828636169433594,
169
+ "learning_rate": 1.8725e-05,
170
+ "loss": 16.456845703125,
171
+ "step": 3750
172
+ },
173
+ {
174
+ "epoch": 0.3417197044124557,
175
+ "grad_norm": 43.49476623535156,
176
+ "learning_rate": 1.9975e-05,
177
+ "loss": 16.399064453125,
178
+ "step": 4000
179
+ },
180
+ {
181
+ "epoch": 0.3417197044124557,
182
+ "eval_loss": 1.919270396232605,
183
+ "eval_runtime": 795.0187,
184
+ "eval_samples_per_second": 99.288,
185
+ "eval_steps_per_second": 12.411,
186
+ "step": 4000
187
+ },
188
+ {
189
+ "epoch": 0.3630771859382342,
190
+ "grad_norm": 41.28815460205078,
191
+ "learning_rate": 2.1225e-05,
192
+ "loss": 16.1804853515625,
193
+ "step": 4250
194
+ },
195
+ {
196
+ "epoch": 0.38443466746401267,
197
+ "grad_norm": 39.76205062866211,
198
+ "learning_rate": 2.2475e-05,
199
+ "loss": 16.03432421875,
200
+ "step": 4500
201
+ },
202
+ {
203
+ "epoch": 0.38443466746401267,
204
+ "eval_loss": 1.8889796733856201,
205
+ "eval_runtime": 793.8887,
206
+ "eval_samples_per_second": 99.43,
207
+ "eval_steps_per_second": 12.429,
208
+ "step": 4500
209
+ },
210
+ {
211
+ "epoch": 0.4057921489897911,
212
+ "grad_norm": 46.443695068359375,
213
+ "learning_rate": 2.372e-05,
214
+ "loss": 15.8476015625,
215
+ "step": 4750
216
+ },
217
+ {
218
+ "epoch": 0.4271496305155696,
219
+ "grad_norm": 37.068084716796875,
220
+ "learning_rate": 2.4970000000000003e-05,
221
+ "loss": 15.7752314453125,
222
+ "step": 5000
223
+ },
224
+ {
225
+ "epoch": 0.4271496305155696,
226
+ "eval_loss": 1.8540898561477661,
227
+ "eval_runtime": 762.2328,
228
+ "eval_samples_per_second": 103.559,
229
+ "eval_steps_per_second": 12.945,
230
+ "step": 5000
231
+ },
232
+ {
233
+ "epoch": 0.4485071120413481,
234
+ "grad_norm": 38.2252082824707,
235
+ "learning_rate": 2.622e-05,
236
+ "loss": 15.5765185546875,
237
+ "step": 5250
238
+ },
239
+ {
240
+ "epoch": 0.46986459356712656,
241
+ "grad_norm": 41.708736419677734,
242
+ "learning_rate": 2.7470000000000003e-05,
243
+ "loss": 15.5412373046875,
244
+ "step": 5500
245
+ },
246
+ {
247
+ "epoch": 0.46986459356712656,
248
+ "eval_loss": 1.8295842409133911,
249
+ "eval_runtime": 763.2977,
250
+ "eval_samples_per_second": 103.414,
251
+ "eval_steps_per_second": 12.927,
252
+ "step": 5500
253
+ },
254
+ {
255
+ "epoch": 0.49122207509290505,
256
+ "grad_norm": 41.928775787353516,
257
+ "learning_rate": 2.8720000000000003e-05,
258
+ "loss": 15.4088125,
259
+ "step": 5750
260
+ },
261
+ {
262
+ "epoch": 0.5125795566186835,
263
+ "grad_norm": 38.48265075683594,
264
+ "learning_rate": 2.9970000000000003e-05,
265
+ "loss": 15.3675712890625,
266
+ "step": 6000
267
+ },
268
+ {
269
+ "epoch": 0.5125795566186835,
270
+ "eval_loss": 1.803719401359558,
271
+ "eval_runtime": 761.5931,
272
+ "eval_samples_per_second": 103.646,
273
+ "eval_steps_per_second": 12.956,
274
+ "step": 6000
275
+ },
276
+ {
277
+ "epoch": 0.533937038144462,
278
+ "grad_norm": 40.2772331237793,
279
+ "learning_rate": 3.122e-05,
280
+ "loss": 15.1469111328125,
281
+ "step": 6250
282
+ },
283
+ {
284
+ "epoch": 0.5552945196702405,
285
+ "grad_norm": 39.967647552490234,
286
+ "learning_rate": 3.247e-05,
287
+ "loss": 15.100412109375,
288
+ "step": 6500
289
+ },
290
+ {
291
+ "epoch": 0.5552945196702405,
292
+ "eval_loss": 1.7818784713745117,
293
+ "eval_runtime": 761.6584,
294
+ "eval_samples_per_second": 103.637,
295
+ "eval_steps_per_second": 12.955,
296
+ "step": 6500
297
+ },
298
+ {
299
+ "epoch": 0.576652001196019,
300
+ "grad_norm": 38.99542999267578,
301
+ "learning_rate": 3.3715000000000005e-05,
302
+ "loss": 15.10202734375,
303
+ "step": 6750
304
+ },
305
+ {
306
+ "epoch": 0.5980094827217974,
307
+ "grad_norm": 38.9607048034668,
308
+ "learning_rate": 3.4965e-05,
309
+ "loss": 14.957875,
310
+ "step": 7000
311
+ },
312
+ {
313
+ "epoch": 0.5980094827217974,
314
+ "eval_loss": 1.7590579986572266,
315
+ "eval_runtime": 763.6639,
316
+ "eval_samples_per_second": 103.365,
317
+ "eval_steps_per_second": 12.921,
318
+ "step": 7000
319
+ },
320
+ {
321
+ "epoch": 0.619366964247576,
322
+ "grad_norm": 36.200218200683594,
323
+ "learning_rate": 3.6215000000000005e-05,
324
+ "loss": 14.8693701171875,
325
+ "step": 7250
326
+ },
327
+ {
328
+ "epoch": 0.6407244457733544,
329
+ "grad_norm": 38.16975402832031,
330
+ "learning_rate": 3.7465e-05,
331
+ "loss": 14.82056640625,
332
+ "step": 7500
333
+ },
334
+ {
335
+ "epoch": 0.6407244457733544,
336
+ "eval_loss": 1.7474839687347412,
337
+ "eval_runtime": 761.4056,
338
+ "eval_samples_per_second": 103.671,
339
+ "eval_steps_per_second": 12.959,
340
+ "step": 7500
341
+ },
342
+ {
343
+ "epoch": 0.6620819272991328,
344
+ "grad_norm": 35.05085372924805,
345
+ "learning_rate": 3.8715000000000005e-05,
346
+ "loss": 14.679634765625,
347
+ "step": 7750
348
+ },
349
+ {
350
+ "epoch": 0.6834394088249114,
351
+ "grad_norm": 39.50191116333008,
352
+ "learning_rate": 3.9965e-05,
353
+ "loss": 14.5730966796875,
354
+ "step": 8000
355
+ },
356
+ {
357
+ "epoch": 0.6834394088249114,
358
+ "eval_loss": 1.731168508529663,
359
+ "eval_runtime": 762.2289,
360
+ "eval_samples_per_second": 103.559,
361
+ "eval_steps_per_second": 12.945,
362
+ "step": 8000
363
+ },
364
+ {
365
+ "epoch": 0.7047968903506898,
366
+ "grad_norm": 39.16671371459961,
367
+ "learning_rate": 4.1215000000000004e-05,
368
+ "loss": 14.58540234375,
369
+ "step": 8250
370
+ },
371
+ {
372
+ "epoch": 0.7261543718764684,
373
+ "grad_norm": 35.04971694946289,
374
+ "learning_rate": 4.246500000000001e-05,
375
+ "loss": 14.4853076171875,
376
+ "step": 8500
377
+ },
378
+ {
379
+ "epoch": 0.7261543718764684,
380
+ "eval_loss": 1.7171440124511719,
381
+ "eval_runtime": 761.2683,
382
+ "eval_samples_per_second": 103.69,
383
+ "eval_steps_per_second": 12.961,
384
+ "step": 8500
385
+ },
386
+ {
387
+ "epoch": 0.7475118534022468,
388
+ "grad_norm": 38.985992431640625,
389
+ "learning_rate": 4.371e-05,
390
+ "loss": 14.4681435546875,
391
+ "step": 8750
392
+ },
393
+ {
394
+ "epoch": 0.7688693349280253,
395
+ "grad_norm": 33.91847610473633,
396
+ "learning_rate": 4.496e-05,
397
+ "loss": 14.435607421875,
398
+ "step": 9000
399
+ },
400
+ {
401
+ "epoch": 0.7688693349280253,
402
+ "eval_loss": 1.7089964151382446,
403
+ "eval_runtime": 763.3649,
404
+ "eval_samples_per_second": 103.405,
405
+ "eval_steps_per_second": 12.926,
406
+ "step": 9000
407
+ },
408
+ {
409
+ "epoch": 0.7902268164538038,
410
+ "grad_norm": 32.30923080444336,
411
+ "learning_rate": 4.6210000000000006e-05,
412
+ "loss": 14.4067099609375,
413
+ "step": 9250
414
+ },
415
+ {
416
+ "epoch": 0.8115842979795822,
417
+ "grad_norm": 33.230995178222656,
418
+ "learning_rate": 4.746e-05,
419
+ "loss": 14.2340126953125,
420
+ "step": 9500
421
+ },
422
+ {
423
+ "epoch": 0.8115842979795822,
424
+ "eval_loss": 1.6928783655166626,
425
+ "eval_runtime": 762.4223,
426
+ "eval_samples_per_second": 103.533,
427
+ "eval_steps_per_second": 12.942,
428
+ "step": 9500
429
+ },
430
+ {
431
+ "epoch": 0.8329417795053607,
432
+ "grad_norm": 32.932621002197266,
433
+ "learning_rate": 4.871e-05,
434
+ "loss": 14.249919921875,
435
+ "step": 9750
436
+ },
437
+ {
438
+ "epoch": 0.8542992610311392,
439
+ "grad_norm": 35.00098419189453,
440
+ "learning_rate": 4.996e-05,
441
+ "loss": 14.2497333984375,
442
+ "step": 10000
443
+ },
444
+ {
445
+ "epoch": 0.8542992610311392,
446
+ "eval_loss": 1.6808847188949585,
447
+ "eval_runtime": 762.5948,
448
+ "eval_samples_per_second": 103.51,
449
+ "eval_steps_per_second": 12.939,
450
+ "step": 10000
451
+ },
452
+ {
453
+ "epoch": 0.8756567425569177,
454
+ "grad_norm": 32.668888092041016,
455
+ "learning_rate": 4.995984523333273e-05,
456
+ "loss": 14.1917099609375,
457
+ "step": 10250
458
+ },
459
+ {
460
+ "epoch": 0.8970142240826962,
461
+ "grad_norm": 30.99444580078125,
462
+ "learning_rate": 4.98341665436926e-05,
463
+ "loss": 14.165974609375,
464
+ "step": 10500
465
+ },
466
+ {
467
+ "epoch": 0.8970142240826962,
468
+ "eval_loss": 1.6745405197143555,
469
+ "eval_runtime": 763.1023,
470
+ "eval_samples_per_second": 103.441,
471
+ "eval_steps_per_second": 12.93,
472
+ "step": 10500
473
+ },
474
+ {
475
+ "epoch": 0.9183717056084747,
476
+ "grad_norm": 33.60852813720703,
477
+ "learning_rate": 4.962436288567254e-05,
478
+ "loss": 14.04737109375,
479
+ "step": 10750
480
+ },
481
+ {
482
+ "epoch": 0.9397291871342531,
483
+ "grad_norm": 33.550537109375,
484
+ "learning_rate": 4.932946882574261e-05,
485
+ "loss": 14.0403681640625,
486
+ "step": 11000
487
+ },
488
+ {
489
+ "epoch": 0.9397291871342531,
490
+ "eval_loss": 1.6584335565567017,
491
+ "eval_runtime": 762.2171,
492
+ "eval_samples_per_second": 103.561,
493
+ "eval_steps_per_second": 12.945,
494
+ "step": 11000
495
+ },
496
+ {
497
+ "epoch": 0.9610866686600316,
498
+ "grad_norm": 31.017929077148438,
499
+ "learning_rate": 4.895116801751093e-05,
500
+ "loss": 14.0180439453125,
501
+ "step": 11250
502
+ },
503
+ {
504
+ "epoch": 0.9824441501858101,
505
+ "grad_norm": 32.50554656982422,
506
+ "learning_rate": 4.849075735901174e-05,
507
+ "loss": 13.85398828125,
508
+ "step": 11500
509
+ },
510
+ {
511
+ "epoch": 0.9824441501858101,
512
+ "eval_loss": 1.6473965644836426,
513
+ "eval_runtime": 761.3432,
514
+ "eval_samples_per_second": 103.68,
515
+ "eval_steps_per_second": 12.96,
516
+ "step": 11500
517
+ },
518
+ {
519
+ "epoch": 1.003758916748537,
520
+ "grad_norm": 32.66862106323242,
521
+ "learning_rate": 4.7949815238831484e-05,
522
+ "loss": 13.788498046875,
523
+ "step": 11750
524
+ },
525
+ {
526
+ "epoch": 1.0251163982743154,
527
+ "grad_norm": 34.95535659790039,
528
+ "learning_rate": 4.7330196125047005e-05,
529
+ "loss": 13.7537568359375,
530
+ "step": 12000
531
+ },
532
+ {
533
+ "epoch": 1.0251163982743154,
534
+ "eval_loss": 1.6361680030822754,
535
+ "eval_runtime": 764.657,
536
+ "eval_samples_per_second": 103.231,
537
+ "eval_steps_per_second": 12.904,
538
+ "step": 12000
539
+ },
540
+ {
541
+ "epoch": 1.0464738798000939,
542
+ "grad_norm": 30.21858787536621,
543
+ "learning_rate": 4.663402420770275e-05,
544
+ "loss": 13.7448203125,
545
+ "step": 12250
546
+ },
547
+ {
548
+ "epoch": 1.0678313613258725,
549
+ "grad_norm": 31.970226287841797,
550
+ "learning_rate": 4.5863686116622025e-05,
551
+ "loss": 13.67769921875,
552
+ "step": 12500
553
+ },
554
+ {
555
+ "epoch": 1.0678313613258725,
556
+ "eval_loss": 1.6223485469818115,
557
+ "eval_runtime": 762.9231,
558
+ "eval_samples_per_second": 103.465,
559
+ "eval_steps_per_second": 12.933,
560
+ "step": 12500
561
+ },
562
+ {
563
+ "epoch": 1.089188842851651,
564
+ "grad_norm": 30.448543548583984,
565
+ "learning_rate": 4.502182273951718e-05,
566
+ "loss": 13.6064111328125,
567
+ "step": 12750
568
+ },
569
+ {
570
+ "epoch": 1.1105463243774294,
571
+ "grad_norm": 31.551868438720703,
572
+ "learning_rate": 4.411132016844809e-05,
573
+ "loss": 13.5927626953125,
574
+ "step": 13000
575
+ },
576
+ {
577
+ "epoch": 1.1105463243774294,
578
+ "eval_loss": 1.6111470460891724,
579
+ "eval_runtime": 662.8254,
580
+ "eval_samples_per_second": 119.09,
581
+ "eval_steps_per_second": 14.886,
582
+ "step": 13000
583
+ },
584
+ {
585
+ "epoch": 1.1319038059032078,
586
+ "grad_norm": 32.45416259765625,
587
+ "learning_rate": 4.313529980566635e-05,
588
+ "loss": 13.48468359375,
589
+ "step": 13250
590
+ },
591
+ {
592
+ "epoch": 1.1532612874289865,
593
+ "grad_norm": 31.863527297973633,
594
+ "learning_rate": 4.209710766276471e-05,
595
+ "loss": 13.452822265625,
596
+ "step": 13500
597
+ },
598
+ {
599
+ "epoch": 1.1532612874289865,
600
+ "eval_loss": 1.6016285419464111,
601
+ "eval_runtime": 661.1194,
602
+ "eval_samples_per_second": 119.397,
603
+ "eval_steps_per_second": 14.925,
604
+ "step": 13500
605
+ },
606
+ {
607
+ "epoch": 1.174618768954765,
608
+ "grad_norm": 30.887378692626953,
609
+ "learning_rate": 4.100030288981636e-05,
610
+ "loss": 13.4295244140625,
611
+ "step": 13750
612
+ },
613
+ {
614
+ "epoch": 1.1959762504805433,
615
+ "grad_norm": 31.169713973999023,
616
+ "learning_rate": 3.984864557382888e-05,
617
+ "loss": 13.3582939453125,
618
+ "step": 14000
619
+ },
620
+ {
621
+ "epoch": 1.1959762504805433,
622
+ "eval_loss": 1.5926363468170166,
623
+ "eval_runtime": 662.3077,
624
+ "eval_samples_per_second": 119.183,
625
+ "eval_steps_per_second": 14.898,
626
+ "step": 14000
627
+ },
628
+ {
629
+ "epoch": 1.2173337320063218,
630
+ "grad_norm": 29.032123565673828,
631
+ "learning_rate": 3.864608384834243e-05,
632
+ "loss": 13.3545703125,
633
+ "step": 14250
634
+ },
635
+ {
636
+ "epoch": 1.2386912135321002,
637
+ "grad_norm": 30.015254974365234,
638
+ "learning_rate": 3.739674035836306e-05,
639
+ "loss": 13.3128515625,
640
+ "step": 14500
641
+ },
642
+ {
643
+ "epoch": 1.2386912135321002,
644
+ "eval_loss": 1.5796525478363037,
645
+ "eval_runtime": 662.1395,
646
+ "eval_samples_per_second": 119.214,
647
+ "eval_steps_per_second": 14.902,
648
+ "step": 14500
649
+ },
650
+ {
651
+ "epoch": 1.2600486950578786,
652
+ "grad_norm": 30.013505935668945,
653
+ "learning_rate": 3.6110144329347815e-05,
654
+ "loss": 13.2648798828125,
655
+ "step": 14750
656
+ },
657
+ {
658
+ "epoch": 1.2814061765836573,
659
+ "grad_norm": 30.784208297729492,
660
+ "learning_rate": 3.478037535477188e-05,
661
+ "loss": 13.2260712890625,
662
+ "step": 15000
663
+ },
664
+ {
665
+ "epoch": 1.2814061765836573,
666
+ "eval_loss": 1.5713889598846436,
667
+ "eval_runtime": 662.045,
668
+ "eval_samples_per_second": 119.231,
669
+ "eval_steps_per_second": 14.904,
670
+ "step": 15000
671
+ },
672
+ {
673
+ "epoch": 1.3027636581094357,
674
+ "grad_norm": 29.118173599243164,
675
+ "learning_rate": 3.341707711117018e-05,
676
+ "loss": 13.1651982421875,
677
+ "step": 15250
678
+ },
679
+ {
680
+ "epoch": 1.3241211396352142,
681
+ "grad_norm": 31.14626693725586,
682
+ "learning_rate": 3.2024923283540886e-05,
683
+ "loss": 13.227046875,
684
+ "step": 15500
685
+ },
686
+ {
687
+ "epoch": 1.3241211396352142,
688
+ "eval_loss": 1.5613423585891724,
689
+ "eval_runtime": 662.4802,
690
+ "eval_samples_per_second": 119.152,
691
+ "eval_steps_per_second": 14.894,
692
+ "step": 15500
693
+ },
694
+ {
695
+ "epoch": 1.3454786211609928,
696
+ "grad_norm": 28.750076293945312,
697
+ "learning_rate": 3.060868648014479e-05,
698
+ "loss": 13.0909404296875,
699
+ "step": 15750
700
+ },
701
+ {
702
+ "epoch": 1.3668361026867712,
703
+ "grad_norm": 28.854137420654297,
704
+ "learning_rate": 2.9173221870958793e-05,
705
+ "loss": 13.083611328125,
706
+ "step": 16000
707
+ },
708
+ {
709
+ "epoch": 1.3668361026867712,
710
+ "eval_loss": 1.556220531463623,
711
+ "eval_runtime": 661.5946,
712
+ "eval_samples_per_second": 119.312,
713
+ "eval_steps_per_second": 14.914,
714
+ "step": 16000
715
+ },
716
+ {
717
+ "epoch": 1.3881935842125497,
718
+ "grad_norm": 31.851211547851562,
719
+ "learning_rate": 2.772345054308973e-05,
720
+ "loss": 13.021517578125,
721
+ "step": 16250
722
+ },
723
+ {
724
+ "epoch": 1.4095510657383281,
725
+ "grad_norm": 29.31368637084961,
726
+ "learning_rate": 2.627019103801507e-05,
727
+ "loss": 13.0297548828125,
728
+ "step": 16500
729
+ },
730
+ {
731
+ "epoch": 1.4095510657383281,
732
+ "eval_loss": 1.5463231801986694,
733
+ "eval_runtime": 661.3847,
734
+ "eval_samples_per_second": 119.35,
735
+ "eval_steps_per_second": 14.919,
736
+ "step": 16500
737
+ },
738
+ {
739
+ "epoch": 1.4309085472641065,
740
+ "grad_norm": 29.341651916503906,
741
+ "learning_rate": 2.4806756029750566e-05,
742
+ "loss": 12.9520859375,
743
+ "step": 16750
744
+ },
745
+ {
746
+ "epoch": 1.452266028789885,
747
+ "grad_norm": 31.251237869262695,
748
+ "learning_rate": 2.334398350414455e-05,
749
+ "loss": 12.9825966796875,
750
+ "step": 17000
751
+ },
752
+ {
753
+ "epoch": 1.452266028789885,
754
+ "eval_loss": 1.5360182523727417,
755
+ "eval_runtime": 661.9359,
756
+ "eval_samples_per_second": 119.25,
757
+ "eval_steps_per_second": 14.906,
758
+ "step": 17000
759
+ },
760
+ {
761
+ "epoch": 1.4736235103156636,
762
+ "grad_norm": 30.922067642211914,
763
+ "learning_rate": 2.1886888165822918e-05,
764
+ "loss": 12.903462890625,
765
+ "step": 17250
766
+ },
767
+ {
768
+ "epoch": 1.494980991841442,
769
+ "grad_norm": 30.14403533935547,
770
+ "learning_rate": 2.044046525677002e-05,
771
+ "loss": 12.9177880859375,
772
+ "step": 17500
773
+ },
774
+ {
775
+ "epoch": 1.494980991841442,
776
+ "eval_loss": 1.5266560316085815,
777
+ "eval_runtime": 662.8613,
778
+ "eval_samples_per_second": 119.084,
779
+ "eval_steps_per_second": 14.885,
780
+ "step": 17500
781
+ },
782
+ {
783
+ "epoch": 1.5163384733672205,
784
+ "grad_norm": 31.758607864379883,
785
+ "learning_rate": 1.9009673431544938e-05,
786
+ "loss": 12.86377734375,
787
+ "step": 17750
788
+ },
789
+ {
790
+ "epoch": 1.5376959548929992,
791
+ "grad_norm": 30.95867347717285,
792
+ "learning_rate": 1.7599417757927578e-05,
793
+ "loss": 12.821025390625,
794
+ "step": 18000
795
+ },
796
+ {
797
+ "epoch": 1.5376959548929992,
798
+ "eval_loss": 1.5217604637145996,
799
+ "eval_runtime": 660.6619,
800
+ "eval_samples_per_second": 119.48,
801
+ "eval_steps_per_second": 14.935,
802
+ "step": 18000
803
+ },
804
+ {
805
+ "epoch": 1.5590534364187776,
806
+ "grad_norm": 30.812349319458008,
807
+ "learning_rate": 1.6214532901271817e-05,
808
+ "loss": 12.7918310546875,
809
+ "step": 18250
810
+ },
811
+ {
812
+ "epoch": 1.580410917944556,
813
+ "grad_norm": 31.66985321044922,
814
+ "learning_rate": 1.4859766550213754e-05,
815
+ "loss": 12.7591337890625,
816
+ "step": 18500
817
+ },
818
+ {
819
+ "epoch": 1.580410917944556,
820
+ "eval_loss": 1.5172350406646729,
821
+ "eval_runtime": 661.9672,
822
+ "eval_samples_per_second": 119.245,
823
+ "eval_steps_per_second": 14.906,
824
+ "step": 18500
825
+ },
826
+ {
827
+ "epoch": 1.6017683994703344,
828
+ "grad_norm": 30.236459732055664,
829
+ "learning_rate": 1.3539763140555073e-05,
830
+ "loss": 12.7556533203125,
831
+ "step": 18750
832
+ },
833
+ {
834
+ "epoch": 1.6231258809961129,
835
+ "grad_norm": 31.713998794555664,
836
+ "learning_rate": 1.2259047933119822e-05,
837
+ "loss": 12.7103583984375,
838
+ "step": 19000
839
+ },
840
+ {
841
+ "epoch": 1.6231258809961129,
842
+ "eval_loss": 1.5090234279632568,
843
+ "eval_runtime": 660.882,
844
+ "eval_samples_per_second": 119.44,
845
+ "eval_steps_per_second": 14.93,
846
+ "step": 19000
847
+ },
848
+ {
849
+ "epoch": 1.6444833625218913,
850
+ "grad_norm": 30.063196182250977,
851
+ "learning_rate": 1.1022011500169055e-05,
852
+ "loss": 12.6835615234375,
853
+ "step": 19250
854
+ },
855
+ {
856
+ "epoch": 1.6658408440476697,
857
+ "grad_norm": 32.952205657958984,
858
+ "learning_rate": 9.83289467355745e-06,
859
+ "loss": 12.618287109375,
860
+ "step": 19500
861
+ },
862
+ {
863
+ "epoch": 1.6658408440476697,
864
+ "eval_loss": 1.5055655241012573,
865
+ "eval_runtime": 663.4281,
866
+ "eval_samples_per_second": 118.982,
867
+ "eval_steps_per_second": 14.873,
868
+ "step": 19500
869
+ },
870
+ {
871
+ "epoch": 1.6871983255734484,
872
+ "grad_norm": 28.919445037841797,
873
+ "learning_rate": 8.700213683961264e-06,
874
+ "loss": 12.6425283203125,
875
+ "step": 19750
876
+ },
877
+ {
878
+ "epoch": 1.7085558070992268,
879
+ "grad_norm": 30.94468879699707,
880
+ "learning_rate": 7.618756381047296e-06,
881
+ "loss": 12.5794033203125,
882
+ "step": 20000
883
+ },
884
+ {
885
+ "epoch": 1.7085558070992268,
886
+ "eval_loss": 1.5013396739959717,
887
+ "eval_runtime": 662.8883,
888
+ "eval_samples_per_second": 119.079,
889
+ "eval_steps_per_second": 14.885,
890
+ "step": 20000
891
+ },
892
+ {
893
+ "epoch": 1.7299132886250055,
894
+ "grad_norm": 29.671031951904297,
895
+ "learning_rate": 6.596885788475471e-06,
896
+ "loss": 12.6140634765625,
897
+ "step": 20250
898
+ },
899
+ {
900
+ "epoch": 1.751270770150784,
901
+ "grad_norm": 29.66603660583496,
902
+ "learning_rate": 5.6381051024693405e-06,
903
+ "loss": 12.59630859375,
904
+ "step": 20500
905
+ },
906
+ {
907
+ "epoch": 1.751270770150784,
908
+ "eval_loss": 1.4975762367248535,
909
+ "eval_runtime": 660.2172,
910
+ "eval_samples_per_second": 119.561,
911
+ "eval_steps_per_second": 14.945,
912
+ "step": 20500
913
+ },
914
+ {
915
+ "epoch": 1.7726282516765623,
916
+ "grad_norm": 32.586578369140625,
917
+ "learning_rate": 4.745701233233446e-06,
918
+ "loss": 12.6129345703125,
919
+ "step": 20750
920
+ },
921
+ {
922
+ "epoch": 1.7939857332023408,
923
+ "grad_norm": 31.325742721557617,
924
+ "learning_rate": 3.922733536705156e-06,
925
+ "loss": 12.5139658203125,
926
+ "step": 21000
927
+ },
928
+ {
929
+ "epoch": 1.7939857332023408,
930
+ "eval_loss": 1.4922269582748413,
931
+ "eval_runtime": 662.5754,
932
+ "eval_samples_per_second": 119.135,
933
+ "eval_steps_per_second": 14.892,
934
+ "step": 21000
935
+ },
936
+ {
937
+ "epoch": 1.8153432147281192,
938
+ "grad_norm": 30.204561233520508,
939
+ "learning_rate": 3.1720233264123627e-06,
940
+ "loss": 12.5135751953125,
941
+ "step": 21250
942
+ },
943
+ {
944
+ "epoch": 1.8367006962538976,
945
+ "grad_norm": 30.57643699645996,
946
+ "learning_rate": 2.496144201392764e-06,
947
+ "loss": 12.489501953125,
948
+ "step": 21500
949
+ },
950
+ {
951
+ "epoch": 1.8367006962538976,
952
+ "eval_loss": 1.4932215213775635,
953
+ "eval_runtime": 661.5906,
954
+ "eval_samples_per_second": 119.312,
955
+ "eval_steps_per_second": 14.914,
956
+ "step": 21500
957
+ },
958
+ {
959
+ "epoch": 1.858058177779676,
960
+ "grad_norm": 29.63056182861328,
961
+ "learning_rate": 1.8974132233326115e-06,
962
+ "loss": 12.557375,
963
+ "step": 21750
964
+ },
965
+ {
966
+ "epoch": 1.8794156593054547,
967
+ "grad_norm": 31.004108428955078,
968
+ "learning_rate": 1.3778829731717153e-06,
969
+ "loss": 12.4930595703125,
970
+ "step": 22000
971
+ },
972
+ {
973
+ "epoch": 1.8794156593054547,
974
+ "eval_loss": 1.4914369583129883,
975
+ "eval_runtime": 672.4142,
976
+ "eval_samples_per_second": 117.392,
977
+ "eval_steps_per_second": 14.674,
978
+ "step": 22000
979
+ },
980
+ {
981
+ "epoch": 1.9007731408312332,
982
+ "grad_norm": 30.86151695251465,
983
+ "learning_rate": 9.393345144063953e-07,
984
+ "loss": 12.465453125,
985
+ "step": 22250
986
+ },
987
+ {
988
+ "epoch": 1.9221306223570118,
989
+ "grad_norm": 30.976634979248047,
990
+ "learning_rate": 5.845295167747261e-07,
991
+ "loss": 12.568541015625,
992
+ "step": 22500
993
+ },
994
+ {
995
+ "epoch": 1.9221306223570118,
996
+ "eval_loss": 1.4907582998275757,
997
+ "eval_runtime": 672.7617,
998
+ "eval_samples_per_second": 117.331,
999
+ "eval_steps_per_second": 14.666,
1000
+ "step": 22500
1001
+ },
1002
+ {
1003
+ "epoch": 1.9434881038827903,
1004
+ "grad_norm": 29.964256286621094,
1005
+ "learning_rate": 3.1183530787943507e-07,
1006
+ "loss": 12.4957490234375,
1007
+ "step": 22750
1008
+ },
1009
+ {
1010
+ "epoch": 1.9648455854085687,
1011
+ "grad_norm": 30.462421417236328,
1012
+ "learning_rate": 1.2377753528518553e-07,
1013
+ "loss": 12.4823271484375,
1014
+ "step": 23000
1015
+ },
1016
+ {
1017
+ "epoch": 1.9648455854085687,
1018
+ "eval_loss": 1.4928914308547974,
1019
+ "eval_runtime": 673.6448,
1020
+ "eval_samples_per_second": 117.177,
1021
+ "eval_steps_per_second": 14.647,
1022
+ "step": 23000
1023
+ },
1024
+ {
1025
+ "epoch": 1.9862030669343471,
1026
+ "grad_norm": 30.932050704956055,
1027
+ "learning_rate": 2.100090222891815e-08,
1028
+ "loss": 12.5745869140625,
1029
+ "step": 23250
1030
+ }
1031
+ ],
1032
+ "logging_steps": 250,
1033
+ "max_steps": 23412,
1034
+ "num_input_tokens_seen": 0,
1035
+ "num_train_epochs": 2,
1036
+ "save_steps": 500,
1037
+ "stateful_callbacks": {
1038
+ "EarlyStoppingCallback": {
1039
+ "args": {
1040
+ "early_stopping_patience": 3,
1041
+ "early_stopping_threshold": 0.0
1042
+ },
1043
+ "attributes": {
1044
+ "early_stopping_patience_counter": 0
1045
+ }
1046
+ },
1047
+ "TrainerControl": {
1048
+ "args": {
1049
+ "should_epoch_stop": false,
1050
+ "should_evaluate": false,
1051
+ "should_log": false,
1052
+ "should_save": true,
1053
+ "should_training_stop": true
1054
+ },
1055
+ "attributes": {}
1056
+ }
1057
+ },
1058
+ "total_flos": 7.486341595504312e+17,
1059
+ "train_batch_size": 16,
1060
+ "trial_name": null,
1061
+ "trial_params": null
1062
+ }
checkpoint-23412/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:39853abe7c212a05cd37a6042b4d1c2f33b18beabbb723de8075009a188aad0f
3
+ size 5201