CodeIsAbstract commited on
Commit
ad958f1
·
verified ·
1 Parent(s): 38b5886

Training in progress, step 20, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6e95a88630e617675befbab4e666351d69d856382da4bda087bb3a19eedb9b10
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:36d47f825f842719e9adc8ec2a96d35e27fb73a091c8034a06f5b1bd0e4f9af0
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6169a4394a09d1aa6e26376804969472c16f7db53679a1fb38b5bf24149df51f
3
  size 350603
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:03a3d87907b233ae85d2a09dc2082cbf577bf60b26f83265e798ffd5cffb3296
3
  size 350603
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0bef41f725df412ca95cdfe05f60b1b444d77c340f60fb943e0b05b8ff85dc70
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e936ced482e7c9446cc6e6e7038e023dc86c658d8bb3b07d132fc5298cce6557
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ab66db99117673b461ceb8f3865fe0441f45aa01085a419aba1737c22700a3ed
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ad4a07c066075e0a1b5d9477b0d2f4d6bab07235ad5efe05720caa179d7171b5
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,382 +2,49 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 1.0,
6
  "eval_steps": 20,
7
- "global_step": 200,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
- "grad_norm": 0.2450859099626541,
15
  "learning_rate": 1.6e-06,
16
- "loss": 21.895669555664064,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
- "grad_norm": 0.2795044779777527,
22
  "learning_rate": 3.6e-06,
23
- "loss": 21.775099182128905,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.075,
28
- "grad_norm": 0.25545090436935425,
29
  "learning_rate": 3.995627254437549e-06,
30
- "loss": 21.680242919921874,
31
  "step": 15
32
  },
33
  {
34
  "epoch": 0.1,
35
- "grad_norm": 0.3522493839263916,
36
  "learning_rate": 3.9778957412029366e-06,
37
- "loss": 21.56825408935547,
38
  "step": 20
39
  },
40
  {
41
  "epoch": 0.1,
42
- "eval_accuracy": 0.012365079365079365,
43
- "eval_loss": 10.798470497131348,
44
- "eval_runtime": 2.4457,
45
- "eval_samples_per_second": 408.879,
46
- "eval_steps_per_second": 68.283,
47
  "step": 20
48
- },
49
- {
50
- "epoch": 0.125,
51
- "grad_norm": 0.34710416197776794,
52
- "learning_rate": 3.9466531944960116e-06,
53
- "loss": 21.448446655273436,
54
- "step": 25
55
- },
56
- {
57
- "epoch": 0.15,
58
- "grad_norm": 0.41463083028793335,
59
- "learning_rate": 3.902113032590307e-06,
60
- "loss": 21.42731628417969,
61
- "step": 30
62
- },
63
- {
64
- "epoch": 0.175,
65
- "grad_norm": 0.4001413583755493,
66
- "learning_rate": 3.844579509954769e-06,
67
- "loss": 21.273895263671875,
68
- "step": 35
69
- },
70
- {
71
- "epoch": 0.2,
72
- "grad_norm": 0.37236735224723816,
73
- "learning_rate": 3.7744456388872234e-06,
74
- "loss": 21.325396728515624,
75
- "step": 40
76
- },
77
- {
78
- "epoch": 0.2,
79
- "eval_accuracy": 0.03863492063492063,
80
- "eval_loss": 10.63491153717041,
81
- "eval_runtime": 2.5692,
82
- "eval_samples_per_second": 389.224,
83
- "eval_steps_per_second": 65.0,
84
- "step": 40
85
- },
86
- {
87
- "epoch": 0.225,
88
- "grad_norm": 0.6012778878211975,
89
- "learning_rate": 3.6921905048418706e-06,
90
- "loss": 21.228472900390624,
91
- "step": 45
92
- },
93
- {
94
- "epoch": 0.25,
95
- "grad_norm": 0.496539831161499,
96
- "learning_rate": 3.598375993789849e-06,
97
- "loss": 21.14513244628906,
98
- "step": 50
99
- },
100
- {
101
- "epoch": 0.275,
102
- "grad_norm": 0.48418062925338745,
103
- "learning_rate": 3.4936429539683075e-06,
104
- "loss": 21.062947082519532,
105
- "step": 55
106
- },
107
- {
108
- "epoch": 0.3,
109
- "grad_norm": 0.542204737663269,
110
- "learning_rate": 3.3787068182371314e-06,
111
- "loss": 20.998651123046876,
112
- "step": 60
113
- },
114
- {
115
- "epoch": 0.3,
116
- "eval_accuracy": 0.05380952380952381,
117
- "eval_loss": 10.491544723510742,
118
- "eval_runtime": 2.5694,
119
- "eval_samples_per_second": 389.199,
120
- "eval_steps_per_second": 64.996,
121
- "step": 60
122
- },
123
- {
124
- "epoch": 0.325,
125
- "grad_norm": 0.5018299221992493,
126
- "learning_rate": 3.254352716947074e-06,
127
- "loss": 21.052398681640625,
128
- "step": 65
129
- },
130
- {
131
- "epoch": 0.35,
132
- "grad_norm": 0.5535529255867004,
133
- "learning_rate": 3.1214301147033453e-06,
134
- "loss": 20.81998291015625,
135
- "step": 70
136
- },
137
- {
138
- "epoch": 0.375,
139
- "grad_norm": 0.6942564249038696,
140
- "learning_rate": 2.9808470076610163e-06,
141
- "loss": 20.625360107421876,
142
- "step": 75
143
- },
144
- {
145
- "epoch": 0.4,
146
- "grad_norm": 0.6362656950950623,
147
- "learning_rate": 2.833563720990581e-06,
148
- "loss": 20.59354248046875,
149
- "step": 80
150
- },
151
- {
152
- "epoch": 0.4,
153
- "eval_accuracy": 0.06626984126984127,
154
- "eval_loss": 10.32943344116211,
155
- "eval_runtime": 2.5422,
156
- "eval_samples_per_second": 393.359,
157
- "eval_steps_per_second": 65.691,
158
- "step": 80
159
- },
160
- {
161
- "epoch": 0.425,
162
- "grad_norm": 0.6189765334129333,
163
- "learning_rate": 2.680586348883286e-06,
164
- "loss": 20.522158813476562,
165
- "step": 85
166
- },
167
- {
168
- "epoch": 0.45,
169
- "grad_norm": 0.5756471157073975,
170
- "learning_rate": 2.5229598819076393e-06,
171
- "loss": 20.492315673828124,
172
- "step": 90
173
- },
174
- {
175
- "epoch": 0.475,
176
- "grad_norm": 0.5617444515228271,
177
- "learning_rate": 2.36176106866422e-06,
178
- "loss": 20.49109802246094,
179
- "step": 95
180
- },
181
- {
182
- "epoch": 0.5,
183
- "grad_norm": 0.5637349486351013,
184
- "learning_rate": 2.198091060500926e-06,
185
- "loss": 20.489166259765625,
186
- "step": 100
187
- },
188
- {
189
- "epoch": 0.5,
190
- "eval_accuracy": 0.0712063492063492,
191
- "eval_loss": 10.189505577087402,
192
- "eval_runtime": 2.8969,
193
- "eval_samples_per_second": 345.191,
194
- "eval_steps_per_second": 57.647,
195
- "step": 100
196
- },
197
- {
198
- "epoch": 0.525,
199
- "grad_norm": 0.5826505422592163,
200
- "learning_rate": 2.033067889532717e-06,
201
- "loss": 20.34880828857422,
202
- "step": 105
203
- },
204
- {
205
- "epoch": 0.55,
206
- "grad_norm": 0.5714936256408691,
207
- "learning_rate": 1.8678188313486012e-06,
208
- "loss": 20.163304138183594,
209
- "step": 110
210
- },
211
- {
212
- "epoch": 0.575,
213
- "grad_norm": 0.7302822470664978,
214
- "learning_rate": 1.7034727045763157e-06,
215
- "loss": 20.174502563476562,
216
- "step": 115
217
- },
218
- {
219
- "epoch": 0.6,
220
- "grad_norm": 0.6190714836120605,
221
- "learning_rate": 1.541152159906497e-06,
222
- "loss": 20.209898376464842,
223
- "step": 120
224
- },
225
- {
226
- "epoch": 0.6,
227
- "eval_accuracy": 0.07126984126984127,
228
- "eval_loss": 10.068880081176758,
229
- "eval_runtime": 2.8029,
230
- "eval_samples_per_second": 356.77,
231
- "eval_steps_per_second": 59.581,
232
- "step": 120
233
- },
234
- {
235
- "epoch": 0.625,
236
- "grad_norm": 0.5889272093772888,
237
- "learning_rate": 1.3819660112501052e-06,
238
- "loss": 20.15807647705078,
239
- "step": 125
240
- },
241
- {
242
- "epoch": 0.65,
243
- "grad_norm": 0.5750179886817932,
244
- "learning_rate": 1.227001661415096e-06,
245
- "loss": 20.040406799316408,
246
- "step": 130
247
- },
248
- {
249
- "epoch": 0.675,
250
- "grad_norm": 0.719745934009552,
251
- "learning_rate": 1.0773176740426246e-06,
252
- "loss": 20.01085662841797,
253
- "step": 135
254
- },
255
- {
256
- "epoch": 0.7,
257
- "grad_norm": 0.7709663510322571,
258
- "learning_rate": 9.339365425440129e-07,
259
- "loss": 19.724040222167968,
260
- "step": 140
261
- },
262
- {
263
- "epoch": 0.7,
264
- "eval_accuracy": 0.07247619047619047,
265
- "eval_loss": 9.954747200012207,
266
- "eval_runtime": 2.6401,
267
- "eval_samples_per_second": 378.767,
268
- "eval_steps_per_second": 63.254,
269
- "step": 140
270
- },
271
- {
272
- "epoch": 0.725,
273
- "grad_norm": 0.7675061821937561,
274
- "learning_rate": 7.978377054339498e-07,
275
- "loss": 19.789096069335937,
276
- "step": 145
277
- },
278
- {
279
- "epoch": 0.75,
280
- "grad_norm": 0.6245450973510742,
281
- "learning_rate": 6.699508557723032e-07,
282
- "loss": 19.786654663085937,
283
- "step": 150
284
- },
285
- {
286
- "epoch": 0.775,
287
- "grad_norm": 0.6990048289299011,
288
- "learning_rate": 5.511495904178221e-07,
289
- "loss": 19.784368896484374,
290
- "step": 155
291
- },
292
- {
293
- "epoch": 0.8,
294
- "grad_norm": 0.6921213269233704,
295
- "learning_rate": 4.4224544247577535e-07,
296
- "loss": 19.664630126953124,
297
- "step": 160
298
- },
299
- {
300
- "epoch": 0.8,
301
- "eval_accuracy": 0.07252380952380952,
302
- "eval_loss": 9.85792350769043,
303
- "eval_runtime": 2.5752,
304
- "eval_samples_per_second": 388.323,
305
- "eval_steps_per_second": 64.85,
306
- "step": 160
307
- },
308
- {
309
- "epoch": 0.825,
310
- "grad_norm": 0.784702479839325,
311
- "learning_rate": 3.439823377039599e-07,
312
- "loss": 19.52422180175781,
313
- "step": 165
314
- },
315
- {
316
- "epoch": 0.85,
317
- "grad_norm": 0.6510916948318481,
318
- "learning_rate": 2.570315127454452e-07,
319
- "loss": 19.38793029785156,
320
- "step": 170
321
- },
322
- {
323
- "epoch": 0.875,
324
- "grad_norm": 0.7473388910293579,
325
- "learning_rate": 1.8198692990167497e-07,
326
- "loss": 19.620166015625,
327
- "step": 175
328
- },
329
- {
330
- "epoch": 0.9,
331
- "grad_norm": 0.9092379212379456,
332
- "learning_rate": 1.1936121976767767e-07,
333
- "loss": 19.587705993652342,
334
- "step": 180
335
- },
336
- {
337
- "epoch": 0.9,
338
- "eval_accuracy": 0.07433333333333333,
339
- "eval_loss": 9.763090133666992,
340
- "eval_runtime": 2.562,
341
- "eval_samples_per_second": 390.315,
342
- "eval_steps_per_second": 65.183,
343
- "step": 180
344
- },
345
- {
346
- "epoch": 0.925,
347
- "grad_norm": 0.7244570255279541,
348
- "learning_rate": 6.958217944530287e-08,
349
- "loss": 19.646340942382814,
350
- "step": 185
351
- },
352
- {
353
- "epoch": 0.95,
354
- "grad_norm": 0.8131192922592163,
355
- "learning_rate": 3.2989850255235265e-08,
356
- "loss": 19.582081604003907,
357
- "step": 190
358
- },
359
- {
360
- "epoch": 0.975,
361
- "grad_norm": 0.8881648182868958,
362
- "learning_rate": 9.834194909977168e-09,
363
- "loss": 19.577865600585938,
364
- "step": 195
365
- },
366
- {
367
- "epoch": 1.0,
368
- "grad_norm": 0.9109742641448975,
369
- "learning_rate": 2.7339001506199164e-10,
370
- "loss": 19.3023681640625,
371
- "step": 200
372
- },
373
- {
374
- "epoch": 1.0,
375
- "eval_accuracy": 0.07755555555555556,
376
- "eval_loss": 9.678764343261719,
377
- "eval_runtime": 2.5817,
378
- "eval_samples_per_second": 387.336,
379
- "eval_steps_per_second": 64.685,
380
- "step": 200
381
  }
382
  ],
383
  "logging_steps": 5,
@@ -392,7 +59,7 @@
392
  "should_evaluate": false,
393
  "should_log": false,
394
  "should_save": true,
395
- "should_training_stop": true
396
  },
397
  "attributes": {}
398
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.1,
6
  "eval_steps": 20,
7
+ "global_step": 20,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
+ "grad_norm": 0.15162423253059387,
15
  "learning_rate": 1.6e-06,
16
+ "loss": 10.962069702148437,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
+ "grad_norm": 0.16617199778556824,
22
  "learning_rate": 3.6e-06,
23
+ "loss": 10.898477935791016,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.075,
28
+ "grad_norm": 0.17574748396873474,
29
  "learning_rate": 3.995627254437549e-06,
30
+ "loss": 10.802017211914062,
31
  "step": 15
32
  },
33
  {
34
  "epoch": 0.1,
35
+ "grad_norm": 0.2199895679950714,
36
  "learning_rate": 3.9778957412029366e-06,
37
+ "loss": 10.78037338256836,
38
  "step": 20
39
  },
40
  {
41
  "epoch": 0.1,
42
+ "eval_accuracy": 0.010476190476190476,
43
+ "eval_loss": 10.812881469726562,
44
+ "eval_runtime": 2.4156,
45
+ "eval_samples_per_second": 413.978,
46
+ "eval_steps_per_second": 69.134,
47
  "step": 20
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
48
  }
49
  ],
50
  "logging_steps": 5,
 
59
  "should_evaluate": false,
60
  "should_log": false,
61
  "should_save": true,
62
+ "should_training_stop": false
63
  },
64
  "attributes": {}
65
  }
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:45a03866db9595121dc0a92697619c52144b0fc40ad7e945dc9cd18869090b4f
3
  size 5265
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4b0b6058a46bce4b387df0ce8c61d4b0b1b316ccf92487321cd86eb8514ad352
3
  size 5265