bimabk commited on
Commit
252f52f
·
verified ·
1 Parent(s): 4faec26

Upload task output 1

Browse files
Files changed (4) hide show
  1. loss.txt +1 -1
  2. model.safetensors +1 -1
  3. trainer_state.json +417 -33
  4. training_args.bin +1 -1
loss.txt CHANGED
@@ -1 +1 @@
1
- ema,3.2474166800966486e-05
 
1
+ 292,0.00010653198114596307
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:317cec56a37e05370fa70da2d6af12feba30fcac9394bccfc476657a419569b9
3
  size 2200119864
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:db049db56e23cb51c422a8f629d2c1a3077b5b3c714d1116de01ccfd8591f159
3
  size 2200119864
trainer_state.json CHANGED
@@ -2,54 +2,438 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 2.4,
6
  "eval_steps": 500,
7
- "global_step": 12,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.8,
14
- "eval_loss": 0.23288792371749878,
15
- "eval_runtime": 0.8962,
16
- "eval_samples_per_second": 29.011,
17
- "eval_steps_per_second": 29.011,
18
- "step": 4
19
  },
20
  {
21
- "epoch": 1.0,
22
- "grad_norm": 16.75,
23
- "learning_rate": 1.034398775510204e-05,
24
- "loss": 0.6023,
25
- "step": 5
26
  },
27
  {
28
- "epoch": 1.6,
29
- "eval_loss": 0.0006179605261422694,
30
- "eval_runtime": 0.7833,
31
- "eval_samples_per_second": 33.192,
32
- "eval_steps_per_second": 33.192,
33
- "step": 8
34
  },
35
  {
36
- "epoch": 2.0,
37
- "grad_norm": 5.84375,
38
- "learning_rate": 2.3273972448979586e-05,
39
- "loss": 0.0269,
40
- "step": 10
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
41
  },
42
  {
43
- "epoch": 2.4,
44
- "eval_loss": 6.324520654743537e-05,
45
- "eval_runtime": 0.7832,
46
- "eval_samples_per_second": 33.196,
47
- "eval_steps_per_second": 33.196,
48
- "step": 12
49
  }
50
  ],
51
  "logging_steps": 5,
52
- "max_steps": 15,
53
  "num_input_tokens_seen": 0,
54
  "num_train_epochs": 3,
55
  "save_steps": 500,
@@ -65,8 +449,8 @@
65
  "attributes": {}
66
  }
67
  },
68
- "total_flos": 1.3703631052210176e+16,
69
- "train_batch_size": 100,
70
  "trial_name": null,
71
  "trial_params": null
72
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 1.9863945578231292,
6
  "eval_steps": 500,
7
+ "global_step": 292,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.034013605442176874,
14
+ "grad_norm": 34.75,
15
+ "learning_rate": 6.430830146224649e-06,
16
+ "loss": 0.6785,
17
+ "step": 5
 
18
  },
19
  {
20
+ "epoch": 0.06802721088435375,
21
+ "grad_norm": 110.0,
22
+ "learning_rate": 1.4469367829005459e-05,
23
+ "loss": 0.15,
24
+ "step": 10
25
  },
26
  {
27
+ "epoch": 0.10204081632653061,
28
+ "grad_norm": 0.00640869140625,
29
+ "learning_rate": 2.2507905511786274e-05,
30
+ "loss": 0.0071,
31
+ "step": 15
 
32
  },
33
  {
34
+ "epoch": 0.1360544217687075,
35
+ "grad_norm": 0.0135498046875,
36
+ "learning_rate": 3.054644319456708e-05,
37
+ "loss": 0.0692,
38
+ "step": 20
39
+ },
40
+ {
41
+ "epoch": 0.17006802721088435,
42
+ "grad_norm": 0.15234375,
43
+ "learning_rate": 3.858498087734789e-05,
44
+ "loss": 0.0616,
45
+ "step": 25
46
+ },
47
+ {
48
+ "epoch": 0.20408163265306123,
49
+ "grad_norm": 0.003021240234375,
50
+ "learning_rate": 4.6623518560128706e-05,
51
+ "loss": 0.0001,
52
+ "step": 30
53
+ },
54
+ {
55
+ "epoch": 0.23809523809523808,
56
+ "grad_norm": 28.875,
57
+ "learning_rate": 5.466205624290951e-05,
58
+ "loss": 0.0322,
59
+ "step": 35
60
+ },
61
+ {
62
+ "epoch": 0.272108843537415,
63
+ "grad_norm": 17.75,
64
+ "learning_rate": 5.6259657079961125e-05,
65
+ "loss": 0.0862,
66
+ "step": 40
67
+ },
68
+ {
69
+ "epoch": 0.30612244897959184,
70
+ "grad_norm": 0.283203125,
71
+ "learning_rate": 5.621861520545433e-05,
72
+ "loss": 0.0157,
73
+ "step": 45
74
+ },
75
+ {
76
+ "epoch": 0.3401360544217687,
77
+ "grad_norm": 0.0096435546875,
78
+ "learning_rate": 5.614606786714469e-05,
79
+ "loss": 0.0441,
80
+ "step": 50
81
+ },
82
+ {
83
+ "epoch": 0.3741496598639456,
84
+ "grad_norm": 0.271484375,
85
+ "learning_rate": 5.604212364632182e-05,
86
+ "loss": 0.0507,
87
+ "step": 55
88
+ },
89
+ {
90
+ "epoch": 0.40816326530612246,
91
+ "grad_norm": 0.02734375,
92
+ "learning_rate": 5.590693811585455e-05,
93
+ "loss": 0.0012,
94
+ "step": 60
95
+ },
96
+ {
97
+ "epoch": 0.4421768707482993,
98
+ "grad_norm": 0.189453125,
99
+ "learning_rate": 5.5740713607345624e-05,
100
+ "loss": 0.0152,
101
+ "step": 65
102
+ },
103
+ {
104
+ "epoch": 0.47619047619047616,
105
+ "grad_norm": 0.05078125,
106
+ "learning_rate": 5.5543698908302936e-05,
107
+ "loss": 0.0634,
108
+ "step": 70
109
+ },
110
+ {
111
+ "epoch": 0.5102040816326531,
112
+ "grad_norm": 42.5,
113
+ "learning_rate": 5.531618888978025e-05,
114
+ "loss": 0.0458,
115
+ "step": 75
116
+ },
117
+ {
118
+ "epoch": 0.54421768707483,
119
+ "grad_norm": 17.25,
120
+ "learning_rate": 5.505852406504504e-05,
121
+ "loss": 0.0562,
122
+ "step": 80
123
+ },
124
+ {
125
+ "epoch": 0.5782312925170068,
126
+ "grad_norm": 10.3125,
127
+ "learning_rate": 5.47710900799337e-05,
128
+ "loss": 0.1128,
129
+ "step": 85
130
+ },
131
+ {
132
+ "epoch": 0.6122448979591837,
133
+ "grad_norm": 17.125,
134
+ "learning_rate": 5.445431713565707e-05,
135
+ "loss": 0.0146,
136
+ "step": 90
137
+ },
138
+ {
139
+ "epoch": 0.6462585034013606,
140
+ "grad_norm": 42.0,
141
+ "learning_rate": 5.4108679344920166e-05,
142
+ "loss": 0.1167,
143
+ "step": 95
144
+ },
145
+ {
146
+ "epoch": 0.6802721088435374,
147
+ "grad_norm": 0.0869140625,
148
+ "learning_rate": 5.373469402231971e-05,
149
+ "loss": 0.0209,
150
+ "step": 100
151
+ },
152
+ {
153
+ "epoch": 0.7142857142857143,
154
+ "grad_norm": 0.8359375,
155
+ "learning_rate": 5.333292091008159e-05,
156
+ "loss": 0.0019,
157
+ "step": 105
158
+ },
159
+ {
160
+ "epoch": 0.7482993197278912,
161
+ "grad_norm": 0.07373046875,
162
+ "learning_rate": 5.290396134029709e-05,
163
+ "loss": 0.0157,
164
+ "step": 110
165
+ },
166
+ {
167
+ "epoch": 0.782312925170068,
168
+ "grad_norm": 0.2578125,
169
+ "learning_rate": 5.244845733491173e-05,
170
+ "loss": 0.0051,
171
+ "step": 115
172
+ },
173
+ {
174
+ "epoch": 0.8163265306122449,
175
+ "grad_norm": 67.5,
176
+ "learning_rate": 5.196709064481376e-05,
177
+ "loss": 0.0181,
178
+ "step": 120
179
+ },
180
+ {
181
+ "epoch": 0.8503401360544217,
182
+ "grad_norm": 0.0478515625,
183
+ "learning_rate": 5.146058172946055e-05,
184
+ "loss": 0.1658,
185
+ "step": 125
186
+ },
187
+ {
188
+ "epoch": 0.8843537414965986,
189
+ "grad_norm": 3.46875,
190
+ "learning_rate": 5.092968867857002e-05,
191
+ "loss": 0.0155,
192
+ "step": 130
193
+ },
194
+ {
195
+ "epoch": 0.9183673469387755,
196
+ "grad_norm": 0.040283203125,
197
+ "learning_rate": 5.037520607749101e-05,
198
+ "loss": 0.0025,
199
+ "step": 135
200
+ },
201
+ {
202
+ "epoch": 0.9523809523809523,
203
+ "grad_norm": 0.80859375,
204
+ "learning_rate": 4.979796381795077e-05,
205
+ "loss": 0.0006,
206
+ "step": 140
207
+ },
208
+ {
209
+ "epoch": 0.9863945578231292,
210
+ "grad_norm": 0.0189208984375,
211
+ "learning_rate": 4.919882585595965e-05,
212
+ "loss": 0.0738,
213
+ "step": 145
214
+ },
215
+ {
216
+ "epoch": 0.9931972789115646,
217
+ "eval_loss": 0.05052933469414711,
218
+ "eval_runtime": 0.8602,
219
+ "eval_samples_per_second": 30.225,
220
+ "eval_steps_per_second": 30.225,
221
+ "step": 146
222
+ },
223
+ {
224
+ "epoch": 1.0204081632653061,
225
+ "grad_norm": 25.0,
226
+ "learning_rate": 4.8578688918731776e-05,
227
+ "loss": 0.0782,
228
+ "step": 150
229
+ },
230
+ {
231
+ "epoch": 1.054421768707483,
232
+ "grad_norm": 0.08349609375,
233
+ "learning_rate": 4.7938481162557315e-05,
234
+ "loss": 0.0015,
235
+ "step": 155
236
+ },
237
+ {
238
+ "epoch": 1.08843537414966,
239
+ "grad_norm": 0.0025177001953125,
240
+ "learning_rate": 4.727916078363493e-05,
241
+ "loss": 0.0082,
242
+ "step": 160
243
+ },
244
+ {
245
+ "epoch": 1.1224489795918366,
246
+ "grad_norm": 0.03515625,
247
+ "learning_rate": 4.6601714583943683e-05,
248
+ "loss": 0.0,
249
+ "step": 165
250
+ },
251
+ {
252
+ "epoch": 1.1564625850340136,
253
+ "grad_norm": 0.0101318359375,
254
+ "learning_rate": 4.590715649430069e-05,
255
+ "loss": 0.0031,
256
+ "step": 170
257
+ },
258
+ {
259
+ "epoch": 1.1904761904761905,
260
+ "grad_norm": 0.01348876953125,
261
+ "learning_rate": 4.519652605681526e-05,
262
+ "loss": 0.0001,
263
+ "step": 175
264
+ },
265
+ {
266
+ "epoch": 1.2244897959183674,
267
+ "grad_norm": 0.0238037109375,
268
+ "learning_rate": 4.447088686901071e-05,
269
+ "loss": 0.0119,
270
+ "step": 180
271
+ },
272
+ {
273
+ "epoch": 1.2585034013605443,
274
+ "grad_norm": 2.515625,
275
+ "learning_rate": 4.373132499194244e-05,
276
+ "loss": 0.0016,
277
+ "step": 185
278
+ },
279
+ {
280
+ "epoch": 1.2925170068027212,
281
+ "grad_norm": 0.059814453125,
282
+ "learning_rate": 4.2978947324695116e-05,
283
+ "loss": 0.0283,
284
+ "step": 190
285
+ },
286
+ {
287
+ "epoch": 1.3265306122448979,
288
+ "grad_norm": 9.1875,
289
+ "learning_rate": 4.221487994769145e-05,
290
+ "loss": 0.0045,
291
+ "step": 195
292
+ },
293
+ {
294
+ "epoch": 1.3605442176870748,
295
+ "grad_norm": 0.015625,
296
+ "learning_rate": 4.144026643729263e-05,
297
+ "loss": 0.005,
298
+ "step": 200
299
+ },
300
+ {
301
+ "epoch": 1.3945578231292517,
302
+ "grad_norm": 0.0034637451171875,
303
+ "learning_rate": 4.06562661542123e-05,
304
+ "loss": 0.0001,
305
+ "step": 205
306
+ },
307
+ {
308
+ "epoch": 1.4285714285714286,
309
+ "grad_norm": 0.016845703125,
310
+ "learning_rate": 3.986405250830651e-05,
311
+ "loss": 0.0369,
312
+ "step": 210
313
+ },
314
+ {
315
+ "epoch": 1.4625850340136055,
316
+ "grad_norm": 0.13671875,
317
+ "learning_rate": 3.9064811202336157e-05,
318
+ "loss": 0.0003,
319
+ "step": 215
320
+ },
321
+ {
322
+ "epoch": 1.4965986394557822,
323
+ "grad_norm": 5.03125,
324
+ "learning_rate": 3.8259738457330774e-05,
325
+ "loss": 0.0025,
326
+ "step": 220
327
+ },
328
+ {
329
+ "epoch": 1.5306122448979593,
330
+ "grad_norm": 0.796875,
331
+ "learning_rate": 3.7450039222209636e-05,
332
+ "loss": 0.0006,
333
+ "step": 225
334
+ },
335
+ {
336
+ "epoch": 1.564625850340136,
337
+ "grad_norm": 0.025146484375,
338
+ "learning_rate": 3.663692537033991e-05,
339
+ "loss": 0.0018,
340
+ "step": 230
341
+ },
342
+ {
343
+ "epoch": 1.598639455782313,
344
+ "grad_norm": 0.057861328125,
345
+ "learning_rate": 3.5821613885731e-05,
346
+ "loss": 0.0072,
347
+ "step": 235
348
+ },
349
+ {
350
+ "epoch": 1.6326530612244898,
351
+ "grad_norm": 0.02783203125,
352
+ "learning_rate": 3.500532504157975e-05,
353
+ "loss": 0.0003,
354
+ "step": 240
355
+ },
356
+ {
357
+ "epoch": 1.6666666666666665,
358
+ "grad_norm": 0.037841796875,
359
+ "learning_rate": 3.418928057389288e-05,
360
+ "loss": 0.0002,
361
+ "step": 245
362
+ },
363
+ {
364
+ "epoch": 1.7006802721088436,
365
+ "grad_norm": 0.01104736328125,
366
+ "learning_rate": 3.337470185291987e-05,
367
+ "loss": 0.0002,
368
+ "step": 250
369
+ },
370
+ {
371
+ "epoch": 1.7346938775510203,
372
+ "grad_norm": 0.044677734375,
373
+ "learning_rate": 3.25628080551334e-05,
374
+ "loss": 0.0156,
375
+ "step": 255
376
+ },
377
+ {
378
+ "epoch": 1.7687074829931972,
379
+ "grad_norm": 0.0037841796875,
380
+ "learning_rate": 3.175481433849315e-05,
381
+ "loss": 0.0002,
382
+ "step": 260
383
+ },
384
+ {
385
+ "epoch": 1.8027210884353742,
386
+ "grad_norm": 0.376953125,
387
+ "learning_rate": 3.0951930023724105e-05,
388
+ "loss": 0.001,
389
+ "step": 265
390
+ },
391
+ {
392
+ "epoch": 1.836734693877551,
393
+ "grad_norm": 0.00799560546875,
394
+ "learning_rate": 3.015535678433143e-05,
395
+ "loss": 0.0,
396
+ "step": 270
397
+ },
398
+ {
399
+ "epoch": 1.870748299319728,
400
+ "grad_norm": 0.00244140625,
401
+ "learning_rate": 2.936628684806084e-05,
402
+ "loss": 0.0001,
403
+ "step": 275
404
+ },
405
+ {
406
+ "epoch": 1.9047619047619047,
407
+ "grad_norm": 0.00170135498046875,
408
+ "learning_rate": 2.858590121249654e-05,
409
+ "loss": 0.0,
410
+ "step": 280
411
+ },
412
+ {
413
+ "epoch": 1.9387755102040818,
414
+ "grad_norm": 0.00762939453125,
415
+ "learning_rate": 2.7815367877467164e-05,
416
+ "loss": 0.0974,
417
+ "step": 285
418
+ },
419
+ {
420
+ "epoch": 1.9727891156462585,
421
+ "grad_norm": 0.002166748046875,
422
+ "learning_rate": 2.7055840096905433e-05,
423
+ "loss": 0.0278,
424
+ "step": 290
425
  },
426
  {
427
+ "epoch": 1.9863945578231292,
428
+ "eval_loss": 0.00010653198114596307,
429
+ "eval_runtime": 0.7953,
430
+ "eval_samples_per_second": 32.69,
431
+ "eval_steps_per_second": 32.69,
432
+ "step": 292
433
  }
434
  ],
435
  "logging_steps": 5,
436
+ "max_steps": 441,
437
  "num_input_tokens_seen": 0,
438
  "num_train_epochs": 3,
439
  "save_steps": 500,
 
449
  "attributes": {}
450
  }
451
  },
452
+ "total_flos": 1.1110365064593408e+16,
453
+ "train_batch_size": 3,
454
  "trial_name": null,
455
  "trial_params": null
456
  }
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2099dbdfd1b8cfacc01b231084544bb8df67f44557302050be6a755618eaf23a
3
  size 5560
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:aede922fcb038c2b2f294f933050cf01eb46c9c0de6a69807b9087c912c03c36
3
  size 5560