CodeIsAbstract commited on
Commit
2dc022e
·
verified ·
1 Parent(s): e97189a

Training in progress, step 20, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4f89efc5dc5f79a1a7d049192202211ff4f4666f74e45acc972ebb8828a7a6fc
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a10239be6e3cd4f5e89f2ac25a3b3c925a1d419acc365d80f558a325fd438b16
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0ac3ea29f8f9795f3342f01cb83d8299ab1810ae892d2b8734f06530209ab1c4
3
  size 350603
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a4558c7ef3834ff59ddefc932ce8df0fd0dd2dc9c93b1481f3635fd4818e96c8
3
  size 350603
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0bef41f725df412ca95cdfe05f60b1b444d77c340f60fb943e0b05b8ff85dc70
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d17c78731e93c053cc5bdd46a999e26416061fc6f401c1eac6682002c6f7cf23
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ab66db99117673b461ceb8f3865fe0441f45aa01085a419aba1737c22700a3ed
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ad4a07c066075e0a1b5d9477b0d2f4d6bab07235ad5efe05720caa179d7171b5
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,382 +2,49 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 1.0,
6
  "eval_steps": 20,
7
- "global_step": 200,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
- "grad_norm": 0.24584950506687164,
15
  "learning_rate": 1.6e-06,
16
- "loss": 22.009127807617187,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
- "grad_norm": 0.2564426362514496,
22
  "learning_rate": 3.6e-06,
23
- "loss": 22.05052947998047,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.075,
28
- "grad_norm": 0.2390100657939911,
29
  "learning_rate": 3.995627254437549e-06,
30
- "loss": 22.014682006835937,
31
  "step": 15
32
  },
33
  {
34
  "epoch": 0.1,
35
- "grad_norm": 0.2513236105442047,
36
  "learning_rate": 3.9778957412029366e-06,
37
- "loss": 22.021099853515626,
38
  "step": 20
39
  },
40
  {
41
  "epoch": 0.1,
42
- "eval_accuracy": 3.1746031746031745e-05,
43
- "eval_loss": 11.020200729370117,
44
- "eval_runtime": 2.4621,
45
- "eval_samples_per_second": 406.152,
46
- "eval_steps_per_second": 67.827,
47
  "step": 20
48
- },
49
- {
50
- "epoch": 0.125,
51
- "grad_norm": 0.25184789299964905,
52
- "learning_rate": 3.9466531944960116e-06,
53
- "loss": 22.0181884765625,
54
- "step": 25
55
- },
56
- {
57
- "epoch": 0.15,
58
- "grad_norm": 0.268789142370224,
59
- "learning_rate": 3.902113032590307e-06,
60
- "loss": 22.01494598388672,
61
- "step": 30
62
- },
63
- {
64
- "epoch": 0.175,
65
- "grad_norm": 0.2609691917896271,
66
- "learning_rate": 3.844579509954769e-06,
67
- "loss": 22.0348876953125,
68
- "step": 35
69
- },
70
- {
71
- "epoch": 0.2,
72
- "grad_norm": 0.2492043823003769,
73
- "learning_rate": 3.7744456388872234e-06,
74
- "loss": 21.99768524169922,
75
- "step": 40
76
- },
77
- {
78
- "epoch": 0.2,
79
- "eval_accuracy": 3.1746031746031745e-05,
80
- "eval_loss": 11.018282890319824,
81
- "eval_runtime": 2.6799,
82
- "eval_samples_per_second": 373.142,
83
- "eval_steps_per_second": 62.315,
84
- "step": 40
85
- },
86
- {
87
- "epoch": 0.225,
88
- "grad_norm": 0.2999836802482605,
89
- "learning_rate": 3.6921905048418706e-06,
90
- "loss": 21.986573791503908,
91
- "step": 45
92
- },
93
- {
94
- "epoch": 0.25,
95
- "grad_norm": 0.2840990126132965,
96
- "learning_rate": 3.598375993789849e-06,
97
- "loss": 22.012301635742187,
98
- "step": 50
99
- },
100
- {
101
- "epoch": 0.275,
102
- "grad_norm": 0.28335806727409363,
103
- "learning_rate": 3.4936429539683075e-06,
104
- "loss": 22.00952606201172,
105
- "step": 55
106
- },
107
- {
108
- "epoch": 0.3,
109
- "grad_norm": 0.2717016935348511,
110
- "learning_rate": 3.3787068182371314e-06,
111
- "loss": 21.99034423828125,
112
- "step": 60
113
- },
114
- {
115
- "epoch": 0.3,
116
- "eval_accuracy": 3.1746031746031745e-05,
117
- "eval_loss": 11.01639175415039,
118
- "eval_runtime": 2.4905,
119
- "eval_samples_per_second": 401.523,
120
- "eval_steps_per_second": 67.054,
121
- "step": 60
122
- },
123
- {
124
- "epoch": 0.325,
125
- "grad_norm": 0.26950836181640625,
126
- "learning_rate": 3.254352716947074e-06,
127
- "loss": 22.037962341308592,
128
- "step": 65
129
- },
130
- {
131
- "epoch": 0.35,
132
- "grad_norm": 0.25924476981163025,
133
- "learning_rate": 3.1214301147033453e-06,
134
- "loss": 22.014053344726562,
135
- "step": 70
136
- },
137
- {
138
- "epoch": 0.375,
139
- "grad_norm": 0.31555065512657166,
140
- "learning_rate": 2.9808470076610163e-06,
141
- "loss": 21.961640930175783,
142
- "step": 75
143
- },
144
- {
145
- "epoch": 0.4,
146
- "grad_norm": 0.2712528705596924,
147
- "learning_rate": 2.833563720990581e-06,
148
- "loss": 21.988558959960937,
149
- "step": 80
150
- },
151
- {
152
- "epoch": 0.4,
153
- "eval_accuracy": 3.1746031746031745e-05,
154
- "eval_loss": 11.01443099975586,
155
- "eval_runtime": 2.612,
156
- "eval_samples_per_second": 382.842,
157
- "eval_steps_per_second": 63.935,
158
- "step": 80
159
- },
160
- {
161
- "epoch": 0.425,
162
- "grad_norm": 0.260957270860672,
163
- "learning_rate": 2.680586348883286e-06,
164
- "loss": 22.034954833984376,
165
- "step": 85
166
- },
167
- {
168
- "epoch": 0.45,
169
- "grad_norm": 0.2659424841403961,
170
- "learning_rate": 2.5229598819076393e-06,
171
- "loss": 22.037962341308592,
172
- "step": 90
173
- },
174
- {
175
- "epoch": 0.475,
176
- "grad_norm": 0.2600838541984558,
177
- "learning_rate": 2.36176106866422e-06,
178
- "loss": 21.996064758300783,
179
- "step": 95
180
- },
181
- {
182
- "epoch": 0.5,
183
- "grad_norm": 0.2419586181640625,
184
- "learning_rate": 2.198091060500926e-06,
185
- "loss": 22.00383605957031,
186
- "step": 100
187
- },
188
- {
189
- "epoch": 0.5,
190
- "eval_accuracy": 3.1746031746031745e-05,
191
- "eval_loss": 11.012611389160156,
192
- "eval_runtime": 2.6096,
193
- "eval_samples_per_second": 383.201,
194
- "eval_steps_per_second": 63.995,
195
- "step": 100
196
- },
197
- {
198
- "epoch": 0.525,
199
- "grad_norm": 0.24510444700717926,
200
- "learning_rate": 2.033067889532717e-06,
201
- "loss": 21.980421447753905,
202
- "step": 105
203
- },
204
- {
205
- "epoch": 0.55,
206
- "grad_norm": 0.24764317274093628,
207
- "learning_rate": 1.8678188313486012e-06,
208
- "loss": 21.973478698730467,
209
- "step": 110
210
- },
211
- {
212
- "epoch": 0.575,
213
- "grad_norm": 0.28122493624687195,
214
- "learning_rate": 1.7034727045763157e-06,
215
- "loss": 21.949703979492188,
216
- "step": 115
217
- },
218
- {
219
- "epoch": 0.6,
220
- "grad_norm": 0.250843346118927,
221
- "learning_rate": 1.541152159906497e-06,
222
- "loss": 21.94451141357422,
223
- "step": 120
224
- },
225
- {
226
- "epoch": 0.6,
227
- "eval_accuracy": 3.1746031746031745e-05,
228
- "eval_loss": 11.010734558105469,
229
- "eval_runtime": 2.7011,
230
- "eval_samples_per_second": 370.215,
231
- "eval_steps_per_second": 61.826,
232
- "step": 120
233
- },
234
- {
235
- "epoch": 0.625,
236
- "grad_norm": 0.24475905299186707,
237
- "learning_rate": 1.3819660112501052e-06,
238
- "loss": 22.0078369140625,
239
- "step": 125
240
- },
241
- {
242
- "epoch": 0.65,
243
- "grad_norm": 0.2379191815853119,
244
- "learning_rate": 1.227001661415096e-06,
245
- "loss": 22.009359741210936,
246
- "step": 130
247
- },
248
- {
249
- "epoch": 0.675,
250
- "grad_norm": 0.26111480593681335,
251
- "learning_rate": 1.0773176740426246e-06,
252
- "loss": 21.976290893554687,
253
- "step": 135
254
- },
255
- {
256
- "epoch": 0.7,
257
- "grad_norm": 0.28270959854125977,
258
- "learning_rate": 9.339365425440129e-07,
259
- "loss": 22.019345092773438,
260
- "step": 140
261
- },
262
- {
263
- "epoch": 0.7,
264
- "eval_accuracy": 3.1746031746031745e-05,
265
- "eval_loss": 11.009251594543457,
266
- "eval_runtime": 2.5123,
267
- "eval_samples_per_second": 398.045,
268
- "eval_steps_per_second": 66.473,
269
- "step": 140
270
- },
271
- {
272
- "epoch": 0.725,
273
- "grad_norm": 0.2701219916343689,
274
- "learning_rate": 7.978377054339498e-07,
275
- "loss": 21.985748291015625,
276
- "step": 145
277
- },
278
- {
279
- "epoch": 0.75,
280
- "grad_norm": 0.24651674926280975,
281
- "learning_rate": 6.699508557723032e-07,
282
- "loss": 22.00152130126953,
283
- "step": 150
284
- },
285
- {
286
- "epoch": 0.775,
287
- "grad_norm": 0.26024770736694336,
288
- "learning_rate": 5.511495904178221e-07,
289
- "loss": 22.02308044433594,
290
- "step": 155
291
- },
292
- {
293
- "epoch": 0.8,
294
- "grad_norm": 0.25778868794441223,
295
- "learning_rate": 4.4224544247577535e-07,
296
- "loss": 21.997288513183594,
297
- "step": 160
298
- },
299
- {
300
- "epoch": 0.8,
301
- "eval_accuracy": 3.1746031746031745e-05,
302
- "eval_loss": 11.007829666137695,
303
- "eval_runtime": 2.7386,
304
- "eval_samples_per_second": 365.156,
305
- "eval_steps_per_second": 60.981,
306
- "step": 160
307
- },
308
- {
309
- "epoch": 0.825,
310
- "grad_norm": 0.2776707112789154,
311
- "learning_rate": 3.439823377039599e-07,
312
- "loss": 22.04285583496094,
313
- "step": 165
314
- },
315
- {
316
- "epoch": 0.85,
317
- "grad_norm": 0.2490997463464737,
318
- "learning_rate": 2.570315127454452e-07,
319
- "loss": 21.98439178466797,
320
- "step": 170
321
- },
322
- {
323
- "epoch": 0.875,
324
- "grad_norm": 0.2551729679107666,
325
- "learning_rate": 1.8198692990167497e-07,
326
- "loss": 21.973941040039062,
327
- "step": 175
328
- },
329
- {
330
- "epoch": 0.9,
331
- "grad_norm": 0.32327187061309814,
332
- "learning_rate": 1.1936121976767767e-07,
333
- "loss": 21.965573120117188,
334
- "step": 180
335
- },
336
- {
337
- "epoch": 0.9,
338
- "eval_accuracy": 3.1746031746031745e-05,
339
- "eval_loss": 11.006654739379883,
340
- "eval_runtime": 2.4962,
341
- "eval_samples_per_second": 400.614,
342
- "eval_steps_per_second": 66.903,
343
- "step": 180
344
- },
345
- {
346
- "epoch": 0.925,
347
- "grad_norm": 0.24408257007598877,
348
- "learning_rate": 6.958217944530287e-08,
349
- "loss": 21.973313903808595,
350
- "step": 185
351
- },
352
- {
353
- "epoch": 0.95,
354
- "grad_norm": 0.2715650796890259,
355
- "learning_rate": 3.2989850255235265e-08,
356
- "loss": 21.963623046875,
357
- "step": 190
358
- },
359
- {
360
- "epoch": 0.975,
361
- "grad_norm": 0.2907275855541229,
362
- "learning_rate": 9.834194909977168e-09,
363
- "loss": 21.96564178466797,
364
- "step": 195
365
- },
366
- {
367
- "epoch": 1.0,
368
- "grad_norm": 0.29036688804626465,
369
- "learning_rate": 2.7339001506199164e-10,
370
- "loss": 21.94970245361328,
371
- "step": 200
372
- },
373
- {
374
- "epoch": 1.0,
375
- "eval_accuracy": 3.1746031746031745e-05,
376
- "eval_loss": 11.00558090209961,
377
- "eval_runtime": 2.4684,
378
- "eval_samples_per_second": 405.122,
379
- "eval_steps_per_second": 67.655,
380
- "step": 200
381
  }
382
  ],
383
  "logging_steps": 5,
@@ -392,7 +59,7 @@
392
  "should_evaluate": false,
393
  "should_log": false,
394
  "should_save": true,
395
- "should_training_stop": true
396
  },
397
  "attributes": {}
398
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.1,
6
  "eval_steps": 20,
7
+ "global_step": 20,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
+ "grad_norm": 0.2450859099626541,
15
  "learning_rate": 1.6e-06,
16
+ "loss": 21.895669555664064,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
+ "grad_norm": 0.2795044779777527,
22
  "learning_rate": 3.6e-06,
23
+ "loss": 21.775099182128905,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.075,
28
+ "grad_norm": 0.25545090436935425,
29
  "learning_rate": 3.995627254437549e-06,
30
+ "loss": 21.680242919921874,
31
  "step": 15
32
  },
33
  {
34
  "epoch": 0.1,
35
+ "grad_norm": 0.3522493839263916,
36
  "learning_rate": 3.9778957412029366e-06,
37
+ "loss": 21.56825408935547,
38
  "step": 20
39
  },
40
  {
41
  "epoch": 0.1,
42
+ "eval_accuracy": 0.012365079365079365,
43
+ "eval_loss": 10.798470497131348,
44
+ "eval_runtime": 2.4457,
45
+ "eval_samples_per_second": 408.879,
46
+ "eval_steps_per_second": 68.283,
47
  "step": 20
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
48
  }
49
  ],
50
  "logging_steps": 5,
 
59
  "should_evaluate": false,
60
  "should_log": false,
61
  "should_save": true,
62
+ "should_training_stop": false
63
  },
64
  "attributes": {}
65
  }