CodeIsAbstract commited on
Commit
f33fad5
·
verified ·
1 Parent(s): a388b6d

Training in progress, step 20, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8baa3e919a54dcc5cb6ec49da621459e4ad270542313a75432e2ab7cd7070880
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2e5eb4a883937e96c950093ab4d6b86746b8c7e18ce6915bc47da02a55ffd429
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8e93d6072d9f7ae5e857bae76cd9d23e8855013f04a94200ed3b0eefe0c65b5b
3
  size 350603
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f5317de9449b47a23fdbfcc31bffea58037950a2d4a4c2f2a29c8e87618fd6a5
3
  size 350603
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bfe80a37e35b074d0f6fac17adedf8f085ded943f9e14bd5132ae4aa50fdab05
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:79277a227d1f9ed20ed2b76370b7fe6a60007b66c24329b5335340d05b155313
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f420a398e501a060ab026373fbb64a49ebca6f8ce9e0b9e60155447b04592b02
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ad4a07c066075e0a1b5d9477b0d2f4d6bab07235ad5efe05720caa179d7171b5
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,345 +2,49 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.9,
6
  "eval_steps": 20,
7
- "global_step": 180,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
- "grad_norm": 0.15162423253059387,
15
  "learning_rate": 1.6e-06,
16
- "loss": 10.962069702148437,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
- "grad_norm": 0.16617199778556824,
22
  "learning_rate": 3.6e-06,
23
- "loss": 10.898477935791016,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.075,
28
- "grad_norm": 0.17574748396873474,
29
  "learning_rate": 3.995627254437549e-06,
30
- "loss": 10.802017211914062,
31
  "step": 15
32
  },
33
  {
34
  "epoch": 0.1,
35
- "grad_norm": 0.2199895679950714,
36
  "learning_rate": 3.9778957412029366e-06,
37
- "loss": 10.78037338256836,
38
  "step": 20
39
  },
40
  {
41
  "epoch": 0.1,
42
- "eval_accuracy": 0.010476190476190476,
43
- "eval_loss": 10.812881469726562,
44
- "eval_runtime": 2.4156,
45
- "eval_samples_per_second": 413.978,
46
- "eval_steps_per_second": 69.134,
47
  "step": 20
48
- },
49
- {
50
- "epoch": 0.125,
51
- "grad_norm": 0.20359881222248077,
52
- "learning_rate": 3.9466531944960116e-06,
53
- "loss": 10.710234832763671,
54
- "step": 25
55
- },
56
- {
57
- "epoch": 0.15,
58
- "grad_norm": 0.2262589931488037,
59
- "learning_rate": 3.902113032590307e-06,
60
- "loss": 10.686376190185547,
61
- "step": 30
62
- },
63
- {
64
- "epoch": 0.175,
65
- "grad_norm": 0.26730242371559143,
66
- "learning_rate": 3.844579509954769e-06,
67
- "loss": 10.716732788085938,
68
- "step": 35
69
- },
70
- {
71
- "epoch": 0.2,
72
- "grad_norm": 0.3094463050365448,
73
- "learning_rate": 3.7744456388872234e-06,
74
- "loss": 10.634027862548828,
75
- "step": 40
76
- },
77
- {
78
- "epoch": 0.2,
79
- "eval_accuracy": 0.034777777777777776,
80
- "eval_loss": 10.648277282714844,
81
- "eval_runtime": 2.6612,
82
- "eval_samples_per_second": 375.767,
83
- "eval_steps_per_second": 62.753,
84
- "step": 40
85
- },
86
- {
87
- "epoch": 0.225,
88
- "grad_norm": 0.281914085149765,
89
- "learning_rate": 3.6921905048418706e-06,
90
- "loss": 10.574553680419921,
91
- "step": 45
92
- },
93
- {
94
- "epoch": 0.25,
95
- "grad_norm": 0.2943774461746216,
96
- "learning_rate": 3.598375993789849e-06,
97
- "loss": 10.494444274902344,
98
- "step": 50
99
- },
100
- {
101
- "epoch": 0.275,
102
- "grad_norm": 0.32790377736091614,
103
- "learning_rate": 3.4936429539683075e-06,
104
- "loss": 10.530224609375,
105
- "step": 55
106
- },
107
- {
108
- "epoch": 0.3,
109
- "grad_norm": 0.41768601536750793,
110
- "learning_rate": 3.3787068182371314e-06,
111
- "loss": 10.44730453491211,
112
- "step": 60
113
- },
114
- {
115
- "epoch": 0.3,
116
- "eval_accuracy": 0.05228571428571428,
117
- "eval_loss": 10.494199752807617,
118
- "eval_runtime": 2.5664,
119
- "eval_samples_per_second": 389.653,
120
- "eval_steps_per_second": 65.072,
121
- "step": 60
122
- },
123
- {
124
- "epoch": 0.325,
125
- "grad_norm": 0.3432864248752594,
126
- "learning_rate": 3.254352716947074e-06,
127
- "loss": 10.377902221679687,
128
- "step": 65
129
- },
130
- {
131
- "epoch": 0.35,
132
- "grad_norm": 0.4390406012535095,
133
- "learning_rate": 3.1214301147033453e-06,
134
- "loss": 10.318882751464844,
135
- "step": 70
136
- },
137
- {
138
- "epoch": 0.375,
139
- "grad_norm": 0.39456093311309814,
140
- "learning_rate": 2.9808470076610163e-06,
141
- "loss": 10.358218383789062,
142
- "step": 75
143
- },
144
- {
145
- "epoch": 0.4,
146
- "grad_norm": 0.3331209719181061,
147
- "learning_rate": 2.833563720990581e-06,
148
- "loss": 10.379315185546876,
149
- "step": 80
150
- },
151
- {
152
- "epoch": 0.4,
153
- "eval_accuracy": 0.05953968253968254,
154
- "eval_loss": 10.34837818145752,
155
- "eval_runtime": 2.5456,
156
- "eval_samples_per_second": 392.837,
157
- "eval_steps_per_second": 65.604,
158
- "step": 80
159
- },
160
- {
161
- "epoch": 0.425,
162
- "grad_norm": 0.394307941198349,
163
- "learning_rate": 2.680586348883286e-06,
164
- "loss": 10.364244842529297,
165
- "step": 85
166
- },
167
- {
168
- "epoch": 0.45,
169
- "grad_norm": 0.6861296892166138,
170
- "learning_rate": 2.5229598819076393e-06,
171
- "loss": 10.229421997070313,
172
- "step": 90
173
- },
174
- {
175
- "epoch": 0.475,
176
- "grad_norm": 0.39627140760421753,
177
- "learning_rate": 2.36176106866422e-06,
178
- "loss": 10.251496124267579,
179
- "step": 95
180
- },
181
- {
182
- "epoch": 0.5,
183
- "grad_norm": 0.48685982823371887,
184
- "learning_rate": 2.198091060500926e-06,
185
- "loss": 10.250384521484374,
186
- "step": 100
187
- },
188
- {
189
- "epoch": 0.5,
190
- "eval_accuracy": 0.06242857142857143,
191
- "eval_loss": 10.20656967163086,
192
- "eval_runtime": 2.4131,
193
- "eval_samples_per_second": 414.406,
194
- "eval_steps_per_second": 69.206,
195
- "step": 100
196
- },
197
- {
198
- "epoch": 0.525,
199
- "grad_norm": 0.4181952476501465,
200
- "learning_rate": 2.033067889532717e-06,
201
- "loss": 10.07513656616211,
202
- "step": 105
203
- },
204
- {
205
- "epoch": 0.55,
206
- "grad_norm": 0.5301581025123596,
207
- "learning_rate": 1.8678188313486012e-06,
208
- "loss": 10.312834930419921,
209
- "step": 110
210
- },
211
- {
212
- "epoch": 0.575,
213
- "grad_norm": 0.5450895428657532,
214
- "learning_rate": 1.7034727045763157e-06,
215
- "loss": 10.073713684082032,
216
- "step": 115
217
- },
218
- {
219
- "epoch": 0.6,
220
- "grad_norm": 0.4884032905101776,
221
- "learning_rate": 1.541152159906497e-06,
222
- "loss": 10.02478485107422,
223
- "step": 120
224
- },
225
- {
226
- "epoch": 0.6,
227
- "eval_accuracy": 0.06626984126984127,
228
- "eval_loss": 10.08950138092041,
229
- "eval_runtime": 2.5801,
230
- "eval_samples_per_second": 387.588,
231
- "eval_steps_per_second": 64.727,
232
- "step": 120
233
- },
234
- {
235
- "epoch": 0.625,
236
- "grad_norm": 0.45030277967453003,
237
- "learning_rate": 1.3819660112501052e-06,
238
- "loss": 10.068260192871094,
239
- "step": 125
240
- },
241
- {
242
- "epoch": 0.65,
243
- "grad_norm": 0.47731924057006836,
244
- "learning_rate": 1.227001661415096e-06,
245
- "loss": 10.119559478759765,
246
- "step": 130
247
- },
248
- {
249
- "epoch": 0.675,
250
- "grad_norm": 0.4541228711605072,
251
- "learning_rate": 1.0773176740426246e-06,
252
- "loss": 10.025191497802734,
253
- "step": 135
254
- },
255
- {
256
- "epoch": 0.7,
257
- "grad_norm": 0.5474848747253418,
258
- "learning_rate": 9.339365425440129e-07,
259
- "loss": 9.916156005859374,
260
- "step": 140
261
- },
262
- {
263
- "epoch": 0.7,
264
- "eval_accuracy": 0.06855555555555555,
265
- "eval_loss": 9.982182502746582,
266
- "eval_runtime": 2.4782,
267
- "eval_samples_per_second": 403.514,
268
- "eval_steps_per_second": 67.387,
269
- "step": 140
270
- },
271
- {
272
- "epoch": 0.725,
273
- "grad_norm": 0.5626335740089417,
274
- "learning_rate": 7.978377054339498e-07,
275
- "loss": 9.81540298461914,
276
- "step": 145
277
- },
278
- {
279
- "epoch": 0.75,
280
- "grad_norm": 0.6244388818740845,
281
- "learning_rate": 6.699508557723032e-07,
282
- "loss": 9.826517486572266,
283
- "step": 150
284
- },
285
- {
286
- "epoch": 0.775,
287
- "grad_norm": 0.42718568444252014,
288
- "learning_rate": 5.511495904178221e-07,
289
- "loss": 9.802256774902343,
290
- "step": 155
291
- },
292
- {
293
- "epoch": 0.8,
294
- "grad_norm": 0.49181056022644043,
295
- "learning_rate": 4.4224544247577535e-07,
296
- "loss": 9.826921081542968,
297
- "step": 160
298
- },
299
- {
300
- "epoch": 0.8,
301
- "eval_accuracy": 0.06917460317460318,
302
- "eval_loss": 9.880888938903809,
303
- "eval_runtime": 2.7588,
304
- "eval_samples_per_second": 362.472,
305
- "eval_steps_per_second": 60.533,
306
- "step": 160
307
- },
308
- {
309
- "epoch": 0.825,
310
- "grad_norm": 0.3924960196018219,
311
- "learning_rate": 3.439823377039599e-07,
312
- "loss": 9.826522064208984,
313
- "step": 165
314
- },
315
- {
316
- "epoch": 0.85,
317
- "grad_norm": 0.49641576409339905,
318
- "learning_rate": 2.570315127454452e-07,
319
- "loss": 9.729110717773438,
320
- "step": 170
321
- },
322
- {
323
- "epoch": 0.875,
324
- "grad_norm": 0.5071141123771667,
325
- "learning_rate": 1.8198692990167497e-07,
326
- "loss": 9.658553314208984,
327
- "step": 175
328
- },
329
- {
330
- "epoch": 0.9,
331
- "grad_norm": 0.46363547444343567,
332
- "learning_rate": 1.1936121976767767e-07,
333
- "loss": 9.751717376708985,
334
- "step": 180
335
- },
336
- {
337
- "epoch": 0.9,
338
- "eval_accuracy": 0.07192063492063493,
339
- "eval_loss": 9.793752670288086,
340
- "eval_runtime": 2.5596,
341
- "eval_samples_per_second": 390.681,
342
- "eval_steps_per_second": 65.244,
343
- "step": 180
344
  }
345
  ],
346
  "logging_steps": 5,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.1,
6
  "eval_steps": 20,
7
+ "global_step": 20,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
+ "grad_norm": 0.12107392400503159,
15
  "learning_rate": 1.6e-06,
16
+ "loss": 10.970177459716798,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
+ "grad_norm": 0.11410612612962723,
22
  "learning_rate": 3.6e-06,
23
+ "loss": 10.963343811035156,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.075,
28
+ "grad_norm": 0.10789366811513901,
29
  "learning_rate": 3.995627254437549e-06,
30
+ "loss": 10.965518951416016,
31
  "step": 15
32
  },
33
  {
34
  "epoch": 0.1,
35
+ "grad_norm": 0.10765355825424194,
36
  "learning_rate": 3.9778957412029366e-06,
37
+ "loss": 10.960431671142578,
38
  "step": 20
39
  },
40
  {
41
  "epoch": 0.1,
42
+ "eval_accuracy": 9.4993894993895e-05,
43
+ "eval_loss": 10.96417236328125,
44
+ "eval_runtime": 91.763,
45
+ "eval_samples_per_second": 10.898,
46
+ "eval_steps_per_second": 1.82,
47
  "step": 20
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
48
  }
49
  ],
50
  "logging_steps": 5,