CodeIsAbstract commited on
Commit
27f4276
·
verified ·
1 Parent(s): d42c6f6

Training in progress, step 20, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:12cdf2f4883dfe1cb904465c7a4280e60176df37be64c2c0be202f1ddef6d40d
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b1eb40a55caeef9711919f7740477d0f2c47cc67ce7a09b1a484527ad8340441
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:dc49098fa120abedb28fd7ea6da1802cfe2e944fb530ea93e0b43c79a14ae2c2
3
- size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:771a18c451612f8e645481bf984c885a29aaaee94750217cb000c1dd7a306e19
3
+ size 350603
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:204484338aec1b64d23614eb2933e81e590b07783a7ad537045df85e45aa13d1
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:97bd3d1a2f58ae7c5971df94ab38f5e952b7947bc754ebd01bb0045964a824d2
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f420a398e501a060ab026373fbb64a49ebca6f8ce9e0b9e60155447b04592b02
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ad4a07c066075e0a1b5d9477b0d2f4d6bab07235ad5efe05720caa179d7171b5
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,345 +2,49 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.9,
6
  "eval_steps": 20,
7
- "global_step": 180,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
- "grad_norm": 6.181037902832031,
15
  "learning_rate": 1.6e-06,
16
- "loss": 21.926864624023438,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
- "grad_norm": 5.942561149597168,
22
  "learning_rate": 3.6e-06,
23
- "loss": 21.75578155517578,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.075,
28
- "grad_norm": 5.655824184417725,
29
  "learning_rate": 3.995627254437549e-06,
30
- "loss": 21.41462097167969,
31
  "step": 15
32
  },
33
  {
34
  "epoch": 0.1,
35
- "grad_norm": 5.417076587677002,
36
  "learning_rate": 3.9778957412029366e-06,
37
- "loss": 21.02429962158203,
38
  "step": 20
39
  },
40
  {
41
  "epoch": 0.1,
42
- "eval_accuracy": 0.062084148727984345,
43
- "eval_loss": 10.375007629394531,
44
- "eval_runtime": 5.7371,
45
- "eval_samples_per_second": 174.305,
46
- "eval_steps_per_second": 29.109,
47
  "step": 20
48
- },
49
- {
50
- "epoch": 0.125,
51
- "grad_norm": 5.290545463562012,
52
- "learning_rate": 3.9466531944960116e-06,
53
- "loss": 20.648074340820312,
54
- "step": 25
55
- },
56
- {
57
- "epoch": 0.15,
58
- "grad_norm": 5.464421272277832,
59
- "learning_rate": 3.902113032590307e-06,
60
- "loss": 20.324154663085938,
61
- "step": 30
62
- },
63
- {
64
- "epoch": 0.175,
65
- "grad_norm": 5.148286819458008,
66
- "learning_rate": 3.844579509954769e-06,
67
- "loss": 20.022116088867186,
68
- "step": 35
69
- },
70
- {
71
- "epoch": 0.2,
72
- "grad_norm": 4.950249195098877,
73
- "learning_rate": 3.7744456388872234e-06,
74
- "loss": 19.932040405273437,
75
- "step": 40
76
- },
77
- {
78
- "epoch": 0.2,
79
- "eval_accuracy": 0.06708610567514676,
80
- "eval_loss": 9.851630210876465,
81
- "eval_runtime": 5.7231,
82
- "eval_samples_per_second": 174.73,
83
- "eval_steps_per_second": 29.18,
84
- "step": 40
85
- },
86
- {
87
- "epoch": 0.225,
88
- "grad_norm": 4.990023612976074,
89
- "learning_rate": 3.6921905048418706e-06,
90
- "loss": 19.716999816894532,
91
- "step": 45
92
- },
93
- {
94
- "epoch": 0.25,
95
- "grad_norm": 4.726850986480713,
96
- "learning_rate": 3.598375993789849e-06,
97
- "loss": 19.490966796875,
98
- "step": 50
99
- },
100
- {
101
- "epoch": 0.275,
102
- "grad_norm": 5.667174339294434,
103
- "learning_rate": 3.4936429539683075e-06,
104
- "loss": 19.308076477050783,
105
- "step": 55
106
- },
107
- {
108
- "epoch": 0.3,
109
- "grad_norm": 4.216722011566162,
110
- "learning_rate": 3.3787068182371314e-06,
111
- "loss": 19.342814636230468,
112
- "step": 60
113
- },
114
- {
115
- "epoch": 0.3,
116
- "eval_accuracy": 0.06902348336594911,
117
- "eval_loss": 9.606650352478027,
118
- "eval_runtime": 5.7327,
119
- "eval_samples_per_second": 174.439,
120
- "eval_steps_per_second": 29.131,
121
- "step": 60
122
- },
123
- {
124
- "epoch": 0.325,
125
- "grad_norm": 4.671233177185059,
126
- "learning_rate": 3.254352716947074e-06,
127
- "loss": 19.091270446777344,
128
- "step": 65
129
- },
130
- {
131
- "epoch": 0.35,
132
- "grad_norm": 4.2631611824035645,
133
- "learning_rate": 3.1214301147033453e-06,
134
- "loss": 19.065214538574217,
135
- "step": 70
136
- },
137
- {
138
- "epoch": 0.375,
139
- "grad_norm": 4.104111671447754,
140
- "learning_rate": 2.9808470076610163e-06,
141
- "loss": 19.055906677246092,
142
- "step": 75
143
- },
144
- {
145
- "epoch": 0.4,
146
- "grad_norm": 4.979343414306641,
147
- "learning_rate": 2.833563720990581e-06,
148
- "loss": 18.942726135253906,
149
- "step": 80
150
- },
151
- {
152
- "epoch": 0.4,
153
- "eval_accuracy": 0.06987084148727984,
154
- "eval_loss": 9.471638679504395,
155
- "eval_runtime": 5.8172,
156
- "eval_samples_per_second": 171.903,
157
- "eval_steps_per_second": 28.708,
158
- "step": 80
159
- },
160
- {
161
- "epoch": 0.425,
162
- "grad_norm": 4.60034704208374,
163
- "learning_rate": 2.680586348883286e-06,
164
- "loss": 18.900166320800782,
165
- "step": 85
166
- },
167
- {
168
- "epoch": 0.45,
169
- "grad_norm": 4.487170696258545,
170
- "learning_rate": 2.5229598819076393e-06,
171
- "loss": 18.824652099609374,
172
- "step": 90
173
- },
174
- {
175
- "epoch": 0.475,
176
- "grad_norm": 4.3784661293029785,
177
- "learning_rate": 2.36176106866422e-06,
178
- "loss": 18.77193603515625,
179
- "step": 95
180
- },
181
- {
182
- "epoch": 0.5,
183
- "grad_norm": 3.88219952583313,
184
- "learning_rate": 2.198091060500926e-06,
185
- "loss": 18.777445983886718,
186
- "step": 100
187
- },
188
- {
189
- "epoch": 0.5,
190
- "eval_accuracy": 0.07486888454011742,
191
- "eval_loss": 9.392426490783691,
192
- "eval_runtime": 5.7667,
193
- "eval_samples_per_second": 173.409,
194
- "eval_steps_per_second": 28.959,
195
- "step": 100
196
- },
197
- {
198
- "epoch": 0.525,
199
- "grad_norm": 3.9933605194091797,
200
- "learning_rate": 2.033067889532717e-06,
201
- "loss": 18.811434936523437,
202
- "step": 105
203
- },
204
- {
205
- "epoch": 0.55,
206
- "grad_norm": 3.9667704105377197,
207
- "learning_rate": 1.8678188313486012e-06,
208
- "loss": 18.78875732421875,
209
- "step": 110
210
- },
211
- {
212
- "epoch": 0.575,
213
- "grad_norm": 4.048539161682129,
214
- "learning_rate": 1.7034727045763157e-06,
215
- "loss": 18.773907470703126,
216
- "step": 115
217
- },
218
- {
219
- "epoch": 0.6,
220
- "grad_norm": 3.9434831142425537,
221
- "learning_rate": 1.541152159906497e-06,
222
- "loss": 18.89387664794922,
223
- "step": 120
224
- },
225
- {
226
- "epoch": 0.6,
227
- "eval_accuracy": 0.0761252446183953,
228
- "eval_loss": 9.337961196899414,
229
- "eval_runtime": 5.872,
230
- "eval_samples_per_second": 170.3,
231
- "eval_steps_per_second": 28.44,
232
- "step": 120
233
- },
234
- {
235
- "epoch": 0.625,
236
- "grad_norm": 3.8308157920837402,
237
- "learning_rate": 1.3819660112501052e-06,
238
- "loss": 18.72384033203125,
239
- "step": 125
240
- },
241
- {
242
- "epoch": 0.65,
243
- "grad_norm": 4.8196702003479,
244
- "learning_rate": 1.227001661415096e-06,
245
- "loss": 18.456109619140626,
246
- "step": 130
247
- },
248
- {
249
- "epoch": 0.675,
250
- "grad_norm": 8.1970796585083,
251
- "learning_rate": 1.0773176740426246e-06,
252
- "loss": 18.59037628173828,
253
- "step": 135
254
- },
255
- {
256
- "epoch": 0.7,
257
- "grad_norm": 4.069243907928467,
258
- "learning_rate": 9.339365425440129e-07,
259
- "loss": 18.677517700195313,
260
- "step": 140
261
- },
262
- {
263
- "epoch": 0.7,
264
- "eval_accuracy": 0.0767279843444227,
265
- "eval_loss": 9.3079252243042,
266
- "eval_runtime": 5.854,
267
- "eval_samples_per_second": 170.824,
268
- "eval_steps_per_second": 28.528,
269
- "step": 140
270
- },
271
- {
272
- "epoch": 0.725,
273
- "grad_norm": 3.915391683578491,
274
- "learning_rate": 7.978377054339498e-07,
275
- "loss": 18.57097473144531,
276
- "step": 145
277
- },
278
- {
279
- "epoch": 0.75,
280
- "grad_norm": 3.8307833671569824,
281
- "learning_rate": 6.699508557723032e-07,
282
- "loss": 18.58392333984375,
283
- "step": 150
284
- },
285
- {
286
- "epoch": 0.775,
287
- "grad_norm": 3.8549070358276367,
288
- "learning_rate": 5.511495904178221e-07,
289
- "loss": 18.670741271972656,
290
- "step": 155
291
- },
292
- {
293
- "epoch": 0.8,
294
- "grad_norm": 3.9556758403778076,
295
- "learning_rate": 4.4224544247577535e-07,
296
- "loss": 18.56670227050781,
297
- "step": 160
298
- },
299
- {
300
- "epoch": 0.8,
301
- "eval_accuracy": 0.07810371819960861,
302
- "eval_loss": 9.292845726013184,
303
- "eval_runtime": 5.9755,
304
- "eval_samples_per_second": 167.349,
305
- "eval_steps_per_second": 27.947,
306
- "step": 160
307
- },
308
- {
309
- "epoch": 0.825,
310
- "grad_norm": 3.857797145843506,
311
- "learning_rate": 3.439823377039599e-07,
312
- "loss": 18.518038940429687,
313
- "step": 165
314
- },
315
- {
316
- "epoch": 0.85,
317
- "grad_norm": 4.037227153778076,
318
- "learning_rate": 2.570315127454452e-07,
319
- "loss": 18.696867370605467,
320
- "step": 170
321
- },
322
- {
323
- "epoch": 0.875,
324
- "grad_norm": 3.76861572265625,
325
- "learning_rate": 1.8198692990167497e-07,
326
- "loss": 18.457827758789062,
327
- "step": 175
328
- },
329
- {
330
- "epoch": 0.9,
331
- "grad_norm": 3.7363455295562744,
332
- "learning_rate": 1.1936121976767767e-07,
333
- "loss": 18.609834289550783,
334
- "step": 180
335
- },
336
- {
337
- "epoch": 0.9,
338
- "eval_accuracy": 0.07823287671232877,
339
- "eval_loss": 9.286931037902832,
340
- "eval_runtime": 5.7992,
341
- "eval_samples_per_second": 172.439,
342
- "eval_steps_per_second": 28.797,
343
- "step": 180
344
  }
345
  ],
346
  "logging_steps": 5,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.1,
6
  "eval_steps": 20,
7
+ "global_step": 20,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
+ "grad_norm": 0.2264673411846161,
15
  "learning_rate": 1.6e-06,
16
+ "loss": 21.980099487304688,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
+ "grad_norm": 0.22343619167804718,
22
  "learning_rate": 3.6e-06,
23
+ "loss": 21.971717834472656,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.075,
28
+ "grad_norm": 0.20869942009449005,
29
  "learning_rate": 3.995627254437549e-06,
30
+ "loss": 21.96947479248047,
31
  "step": 15
32
  },
33
  {
34
  "epoch": 0.1,
35
+ "grad_norm": 0.2140372395515442,
36
  "learning_rate": 3.9778957412029366e-06,
37
+ "loss": 21.95387420654297,
38
  "step": 20
39
  },
40
  {
41
  "epoch": 0.1,
42
+ "eval_accuracy": 7.827788649706458e-06,
43
+ "eval_loss": 10.985608100891113,
44
+ "eval_runtime": 5.5324,
45
+ "eval_samples_per_second": 180.754,
46
+ "eval_steps_per_second": 30.186,
47
  "step": 20
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
48
  }
49
  ],
50
  "logging_steps": 5,