CodeIsAbstract commited on
Commit
f3224d7
·
verified ·
1 Parent(s): 4d6d8c5

Training in progress, step 100, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:af6da459219a0dfd520f8f9bef95d70b69541238260a186de064e8b3b9622d4b
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d7390f9f81e59c76a9d6ab0d8c707f4c87f467164b72cc20add67201bd21852d
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:95176d612444486929b2741997bdaf23b4fa67dd8b2c66bf57fa5ea76b78cfed
3
  size 350603
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:07c259decfaab80c17538e818b27844a7997ae01f1bc68bd0351e7c7013d6966
3
  size 350603
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:65c0ddce770129db8af78a8281e61b32c4aba3200b93375ffc428f456531d83d
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9373077514cae46a49373636d8533017b0efe6437cb3126984a56adfa969ea82
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ab66db99117673b461ceb8f3865fe0441f45aa01085a419aba1737c22700a3ed
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7815f17b7bd928390d8a057e2a19101b8f840de5d7f859603bfc35694ee86edf
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,328 +2,170 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 1.0,
6
  "eval_steps": 50,
7
- "global_step": 200,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
- "grad_norm": 0.17093215882778168,
15
  "learning_rate": 1.6e-06,
16
- "loss": 10.88990478515625,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
- "grad_norm": 0.2938487231731415,
22
  "learning_rate": 3.6e-06,
23
- "loss": 10.514610290527344,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.075,
28
- "grad_norm": 0.37134891748428345,
29
  "learning_rate": 3.995627254437549e-06,
30
- "loss": 10.039398193359375,
31
  "step": 15
32
  },
33
  {
34
  "epoch": 0.1,
35
- "grad_norm": 0.2268853634595871,
36
  "learning_rate": 3.9778957412029366e-06,
37
- "loss": 9.626433563232421,
38
  "step": 20
39
  },
40
  {
41
  "epoch": 0.125,
42
- "grad_norm": 0.2303772270679474,
43
  "learning_rate": 3.9466531944960116e-06,
44
- "loss": 9.306468963623047,
45
  "step": 25
46
  },
47
  {
48
  "epoch": 0.15,
49
- "grad_norm": 0.20847690105438232,
50
  "learning_rate": 3.902113032590307e-06,
51
- "loss": 9.164946746826171,
52
  "step": 30
53
  },
54
  {
55
  "epoch": 0.175,
56
- "grad_norm": 0.18881037831306458,
57
  "learning_rate": 3.844579509954769e-06,
58
- "loss": 9.01562728881836,
59
  "step": 35
60
  },
61
  {
62
  "epoch": 0.2,
63
- "grad_norm": 0.14287346601486206,
64
  "learning_rate": 3.7744456388872234e-06,
65
- "loss": 8.989354705810547,
66
  "step": 40
67
  },
68
  {
69
  "epoch": 0.225,
70
- "grad_norm": 0.16693444550037384,
71
  "learning_rate": 3.6921905048418706e-06,
72
- "loss": 8.803133392333985,
73
  "step": 45
74
  },
75
  {
76
  "epoch": 0.25,
77
- "grad_norm": 0.12351641803979874,
78
  "learning_rate": 3.598375993789849e-06,
79
- "loss": 8.753093719482422,
80
  "step": 50
81
  },
82
  {
83
  "epoch": 0.25,
84
- "eval_accuracy": 0.10913064713064713,
85
- "eval_loss": 8.707348823547363,
86
- "eval_runtime": 10.3624,
87
- "eval_samples_per_second": 9.65,
88
- "eval_steps_per_second": 1.641,
89
  "step": 50
90
  },
91
  {
92
  "epoch": 0.275,
93
- "grad_norm": 0.11024487018585205,
94
  "learning_rate": 3.4936429539683075e-06,
95
- "loss": 8.706148529052735,
96
  "step": 55
97
  },
98
  {
99
  "epoch": 0.3,
100
- "grad_norm": 0.11397001892328262,
101
  "learning_rate": 3.3787068182371314e-06,
102
- "loss": 8.635591125488281,
103
  "step": 60
104
  },
105
  {
106
  "epoch": 0.325,
107
- "grad_norm": 0.11307007819414139,
108
  "learning_rate": 3.254352716947074e-06,
109
- "loss": 8.56150131225586,
110
  "step": 65
111
  },
112
  {
113
  "epoch": 0.35,
114
- "grad_norm": 0.11745881289243698,
115
  "learning_rate": 3.1214301147033453e-06,
116
- "loss": 8.52124252319336,
117
  "step": 70
118
  },
119
  {
120
  "epoch": 0.375,
121
- "grad_norm": 0.10288426280021667,
122
  "learning_rate": 2.9808470076610163e-06,
123
- "loss": 8.491536712646484,
124
  "step": 75
125
  },
126
  {
127
  "epoch": 0.4,
128
- "grad_norm": 0.11181551218032837,
129
  "learning_rate": 2.833563720990581e-06,
130
- "loss": 8.444434356689452,
131
  "step": 80
132
  },
133
  {
134
  "epoch": 0.425,
135
- "grad_norm": 0.10100872069597244,
136
  "learning_rate": 2.680586348883286e-06,
137
- "loss": 8.523983764648438,
138
  "step": 85
139
  },
140
  {
141
  "epoch": 0.45,
142
- "grad_norm": 0.09801367670297623,
143
  "learning_rate": 2.5229598819076393e-06,
144
- "loss": 8.447149658203125,
145
  "step": 90
146
  },
147
  {
148
  "epoch": 0.475,
149
- "grad_norm": 0.09665904939174652,
150
  "learning_rate": 2.36176106866422e-06,
151
- "loss": 8.304853820800782,
152
  "step": 95
153
  },
154
  {
155
  "epoch": 0.5,
156
- "grad_norm": 0.08705192059278488,
157
  "learning_rate": 2.198091060500926e-06,
158
- "loss": 8.243639373779297,
159
  "step": 100
160
  },
161
  {
162
  "epoch": 0.5,
163
- "eval_accuracy": 0.11717704517704518,
164
- "eval_loss": 8.261603355407715,
165
- "eval_runtime": 10.4554,
166
- "eval_samples_per_second": 9.564,
167
- "eval_steps_per_second": 1.626,
168
  "step": 100
169
- },
170
- {
171
- "epoch": 0.525,
172
- "grad_norm": 0.08703620731830597,
173
- "learning_rate": 2.033067889532717e-06,
174
- "loss": 8.251353454589843,
175
- "step": 105
176
- },
177
- {
178
- "epoch": 0.55,
179
- "grad_norm": 0.08461801707744598,
180
- "learning_rate": 1.8678188313486012e-06,
181
- "loss": 8.270049285888671,
182
- "step": 110
183
- },
184
- {
185
- "epoch": 0.575,
186
- "grad_norm": 0.09749548882246017,
187
- "learning_rate": 1.7034727045763157e-06,
188
- "loss": 8.217508697509766,
189
- "step": 115
190
- },
191
- {
192
- "epoch": 0.6,
193
- "grad_norm": 0.08456026017665863,
194
- "learning_rate": 1.541152159906497e-06,
195
- "loss": 8.169024658203124,
196
- "step": 120
197
- },
198
- {
199
- "epoch": 0.625,
200
- "grad_norm": 0.07748560607433319,
201
- "learning_rate": 1.3819660112501052e-06,
202
- "loss": 8.160218811035156,
203
- "step": 125
204
- },
205
- {
206
- "epoch": 0.65,
207
- "grad_norm": 0.07981108874082565,
208
- "learning_rate": 1.227001661415096e-06,
209
- "loss": 8.195584869384765,
210
- "step": 130
211
- },
212
- {
213
- "epoch": 0.675,
214
- "grad_norm": 0.0858621671795845,
215
- "learning_rate": 1.0773176740426246e-06,
216
- "loss": 8.155872344970703,
217
- "step": 135
218
- },
219
- {
220
- "epoch": 0.7,
221
- "grad_norm": 0.07770797610282898,
222
- "learning_rate": 9.339365425440129e-07,
223
- "loss": 8.076512908935547,
224
- "step": 140
225
- },
226
- {
227
- "epoch": 0.725,
228
- "grad_norm": 0.08947437256574631,
229
- "learning_rate": 7.978377054339498e-07,
230
- "loss": 8.029309844970703,
231
- "step": 145
232
- },
233
- {
234
- "epoch": 0.75,
235
- "grad_norm": 0.08842209726572037,
236
- "learning_rate": 6.699508557723032e-07,
237
- "loss": 8.074932098388672,
238
- "step": 150
239
- },
240
- {
241
- "epoch": 0.75,
242
- "eval_accuracy": 0.11846153846153847,
243
- "eval_loss": 8.003965377807617,
244
- "eval_runtime": 10.4627,
245
- "eval_samples_per_second": 9.558,
246
- "eval_steps_per_second": 1.625,
247
- "step": 150
248
- },
249
- {
250
- "epoch": 0.775,
251
- "grad_norm": 0.08069568127393723,
252
- "learning_rate": 5.511495904178221e-07,
253
- "loss": 8.015203857421875,
254
- "step": 155
255
- },
256
- {
257
- "epoch": 0.8,
258
- "grad_norm": 0.08167938143014908,
259
- "learning_rate": 4.4224544247577535e-07,
260
- "loss": 8.024001312255859,
261
- "step": 160
262
- },
263
- {
264
- "epoch": 0.825,
265
- "grad_norm": 0.07335270941257477,
266
- "learning_rate": 3.439823377039599e-07,
267
- "loss": 8.014215087890625,
268
- "step": 165
269
- },
270
- {
271
- "epoch": 0.85,
272
- "grad_norm": 0.09198863804340363,
273
- "learning_rate": 2.570315127454452e-07,
274
- "loss": 7.948513031005859,
275
- "step": 170
276
- },
277
- {
278
- "epoch": 0.875,
279
- "grad_norm": 0.09853670746088028,
280
- "learning_rate": 1.8198692990167497e-07,
281
- "loss": 7.839792633056641,
282
- "step": 175
283
- },
284
- {
285
- "epoch": 0.9,
286
- "grad_norm": 0.07276590168476105,
287
- "learning_rate": 1.1936121976767767e-07,
288
- "loss": 7.897310638427735,
289
- "step": 180
290
- },
291
- {
292
- "epoch": 0.925,
293
- "grad_norm": 0.10586628317832947,
294
- "learning_rate": 6.958217944530287e-08,
295
- "loss": 8.082672882080079,
296
- "step": 185
297
- },
298
- {
299
- "epoch": 0.95,
300
- "grad_norm": 0.09799101948738098,
301
- "learning_rate": 3.2989850255235265e-08,
302
- "loss": 7.902798461914062,
303
- "step": 190
304
- },
305
- {
306
- "epoch": 0.975,
307
- "grad_norm": 0.06515993922948837,
308
- "learning_rate": 9.834194909977168e-09,
309
- "loss": 7.907355499267578,
310
- "step": 195
311
- },
312
- {
313
- "epoch": 1.0,
314
- "grad_norm": 0.0806872770190239,
315
- "learning_rate": 2.7339001506199164e-10,
316
- "loss": 7.868655395507813,
317
- "step": 200
318
- },
319
- {
320
- "epoch": 1.0,
321
- "eval_accuracy": 0.1221123321123321,
322
- "eval_loss": 7.8275146484375,
323
- "eval_runtime": 10.3834,
324
- "eval_samples_per_second": 9.631,
325
- "eval_steps_per_second": 1.637,
326
- "step": 200
327
  }
328
  ],
329
  "logging_steps": 5,
@@ -338,7 +180,7 @@
338
  "should_evaluate": false,
339
  "should_log": false,
340
  "should_save": true,
341
- "should_training_stop": true
342
  },
343
  "attributes": {}
344
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.5,
6
  "eval_steps": 50,
7
+ "global_step": 100,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
+ "grad_norm": 0.28224506974220276,
15
  "learning_rate": 1.6e-06,
16
+ "loss": 10.72566909790039,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
+ "grad_norm": 0.3270684778690338,
22
  "learning_rate": 3.6e-06,
23
+ "loss": 9.934751892089844,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.075,
28
+ "grad_norm": 0.16773350536823273,
29
  "learning_rate": 3.995627254437549e-06,
30
+ "loss": 9.331498718261718,
31
  "step": 15
32
  },
33
  {
34
  "epoch": 0.1,
35
+ "grad_norm": 0.14517103135585785,
36
  "learning_rate": 3.9778957412029366e-06,
37
+ "loss": 9.084286499023438,
38
  "step": 20
39
  },
40
  {
41
  "epoch": 0.125,
42
+ "grad_norm": 0.15857668220996857,
43
  "learning_rate": 3.9466531944960116e-06,
44
+ "loss": 8.825327301025391,
45
  "step": 25
46
  },
47
  {
48
  "epoch": 0.15,
49
+ "grad_norm": 0.12968920171260834,
50
  "learning_rate": 3.902113032590307e-06,
51
+ "loss": 8.735884094238282,
52
  "step": 30
53
  },
54
  {
55
  "epoch": 0.175,
56
+ "grad_norm": 0.11413325369358063,
57
  "learning_rate": 3.844579509954769e-06,
58
+ "loss": 8.606085968017577,
59
  "step": 35
60
  },
61
  {
62
  "epoch": 0.2,
63
+ "grad_norm": 0.17233271896839142,
64
  "learning_rate": 3.7744456388872234e-06,
65
+ "loss": 8.629763793945312,
66
  "step": 40
67
  },
68
  {
69
  "epoch": 0.225,
70
+ "grad_norm": 0.11048762500286102,
71
  "learning_rate": 3.6921905048418706e-06,
72
+ "loss": 8.442276000976562,
73
  "step": 45
74
  },
75
  {
76
  "epoch": 0.25,
77
+ "grad_norm": 0.08961036801338196,
78
  "learning_rate": 3.598375993789849e-06,
79
+ "loss": 8.383564758300782,
80
  "step": 50
81
  },
82
  {
83
  "epoch": 0.25,
84
+ "eval_accuracy": 0.11198778998778999,
85
+ "eval_loss": 8.327370643615723,
86
+ "eval_runtime": 10.4343,
87
+ "eval_samples_per_second": 9.584,
88
+ "eval_steps_per_second": 1.629,
89
  "step": 50
90
  },
91
  {
92
  "epoch": 0.275,
93
+ "grad_norm": 0.08887746930122375,
94
  "learning_rate": 3.4936429539683075e-06,
95
+ "loss": 8.346420288085938,
96
  "step": 55
97
  },
98
  {
99
  "epoch": 0.3,
100
+ "grad_norm": 0.0796026661992073,
101
  "learning_rate": 3.3787068182371314e-06,
102
+ "loss": 8.269767761230469,
103
  "step": 60
104
  },
105
  {
106
  "epoch": 0.325,
107
+ "grad_norm": 0.09607570618391037,
108
  "learning_rate": 3.254352716947074e-06,
109
+ "loss": 8.19412841796875,
110
  "step": 65
111
  },
112
  {
113
  "epoch": 0.35,
114
+ "grad_norm": 0.1087556928396225,
115
  "learning_rate": 3.1214301147033453e-06,
116
+ "loss": 8.142083740234375,
117
  "step": 70
118
  },
119
  {
120
  "epoch": 0.375,
121
+ "grad_norm": 0.08590473234653473,
122
  "learning_rate": 2.9808470076610163e-06,
123
+ "loss": 8.119364929199218,
124
  "step": 75
125
  },
126
  {
127
  "epoch": 0.4,
128
+ "grad_norm": 0.10873208194971085,
129
  "learning_rate": 2.833563720990581e-06,
130
+ "loss": 8.084170532226562,
131
  "step": 80
132
  },
133
  {
134
  "epoch": 0.425,
135
+ "grad_norm": 0.08005784451961517,
136
  "learning_rate": 2.680586348883286e-06,
137
+ "loss": 8.164724731445313,
138
  "step": 85
139
  },
140
  {
141
  "epoch": 0.45,
142
+ "grad_norm": 0.07923667132854462,
143
  "learning_rate": 2.5229598819076393e-06,
144
+ "loss": 8.08359603881836,
145
  "step": 90
146
  },
147
  {
148
  "epoch": 0.475,
149
+ "grad_norm": 0.08169477432966232,
150
  "learning_rate": 2.36176106866422e-06,
151
+ "loss": 7.9432830810546875,
152
  "step": 95
153
  },
154
  {
155
  "epoch": 0.5,
156
+ "grad_norm": 0.0804147943854332,
157
  "learning_rate": 2.198091060500926e-06,
158
+ "loss": 7.901922607421875,
159
  "step": 100
160
  },
161
  {
162
  "epoch": 0.5,
163
+ "eval_accuracy": 0.1186935286935287,
164
+ "eval_loss": 7.899251937866211,
165
+ "eval_runtime": 10.4815,
166
+ "eval_samples_per_second": 9.541,
167
+ "eval_steps_per_second": 1.622,
168
  "step": 100
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
169
  }
170
  ],
171
  "logging_steps": 5,
 
180
  "should_evaluate": false,
181
  "should_log": false,
182
  "should_save": true,
183
+ "should_training_stop": false
184
  },
185
  "attributes": {}
186
  }