CodeIsAbstract commited on
Commit
bd510e9
·
verified ·
1 Parent(s): 67918c3

Training in progress, step 1000, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:71a54c527a33f70d78ce72260eeb46972b58e885b72ef3dfa0e6cc0f9688399f
3
  size 386379
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5c6171884fc5ed61ffbfa0a174a5acb2997f78839dcb07c9215894ea7eb46b3f
3
  size 386379
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cd76ca7ba0bf198b8ad479ccdd911afaab0648bdaf7b3f0f15806b98b32231d0
3
  size 1540661735
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d0f0a88414d5186ed3a1e4103812e3fc4d88c6bf1e1ee04d19804baa9161d859
3
  size 1540661735
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:21921ded89d3efb325b0f105635a2e638ac3849bf9d5ddc032cf285c7acce9df
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4d00a3dd4f7abe58957368cd7aff452ace8a57686fb0dac78358755bb8642321
3
  size 14469
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2c3ef5862d26b8869e6c9e8a6807701995c18e51a48f7f36ceda1b5abeed0909
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9482f6d70f9ae4bc67feace2bbb0ecc13b0b9af42fdc5a5469cbeef07dfa096e
3
  size 14469
last-checkpoint/rng_state_2.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e2ffd59099867021edcfb0ac2baab041eb4a4af12f556bedc1ab80ec65d990ef
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8200969ca1f32712b57dc8f347ad6b46fc031f51c43a7f55dee257c56cc13e4b
3
  size 14469
last-checkpoint/rng_state_3.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:33e740bf1fa07b2703f88f14c6cf127f399fc76fbcdb55bc579c2b3e0e29cc02
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:633d31824581e976aa18ec3d2ab0717eea67f5b90d4174990b4873ca129ad2c8
3
  size 14469
last-checkpoint/rng_state_4.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:97342e1218bd168184eb81a3ba9ece8327ff8377151f7c84b89a8ad1cc5bf7ed
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:20282f7a7bf1d4a56474e211a37ba9dd6beebf595d753cb361e99f1f0ee0273e
3
  size 14469
last-checkpoint/rng_state_5.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:402e70719eb092137380f0c146f2dd612f92092b503b35850f99d43e15b22645
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1f39c623ce268e81c5c5b4c8769dd2c43878eabeac8d8687553f3e42cf959135
3
  size 14469
last-checkpoint/rng_state_6.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4f39d1c0b40d5df607853ccb440ef174a83084d925f20ee2125e5030a6c85632
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1283a443ddde18cfb625127fe7c73f18da80b11341bf9bb2c96e4d2fe0266cdb
3
  size 14469
last-checkpoint/rng_state_7.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6dcd028341979c2e359a61e18bb04bf5424e94e780cb8c2f9bc4ed21b1f02b37
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:18d72c57b4f3fbac90d20121db0f91377be19a3257d1bbb4ca0eca26155cbd95
3
  size 14469
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5b79cc0df1e63ecef3adaaf8ef4c455eb58ccb70431c624030057057995b60a8
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:94b7b1a014f5dad743694fda5858015bfe3bd4c82eac608d649238b91858a560
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.5,
6
  "eval_steps": 50,
7
- "global_step": 500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
@@ -133,6 +133,131 @@
133
  "eval_samples_per_second": 14.552,
134
  "eval_steps_per_second": 1.863,
135
  "step": 500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
136
  }
137
  ],
138
  "logging_steps": 100,
@@ -147,7 +272,7 @@
147
  "should_evaluate": false,
148
  "should_log": false,
149
  "should_save": true,
150
- "should_training_stop": false
151
  },
152
  "attributes": {}
153
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 1.0,
6
  "eval_steps": 50,
7
+ "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
 
133
  "eval_samples_per_second": 14.552,
134
  "eval_steps_per_second": 1.863,
135
  "step": 500
136
+ },
137
+ {
138
+ "epoch": 0.55,
139
+ "eval_accuracy": 0.1651023622047244,
140
+ "eval_loss": 47.143985748291016,
141
+ "eval_runtime": 10.7415,
142
+ "eval_samples_per_second": 11.637,
143
+ "eval_steps_per_second": 1.49,
144
+ "step": 550
145
+ },
146
+ {
147
+ "epoch": 0.6,
148
+ "grad_norm": 9027.2001953125,
149
+ "learning_rate": 0.0001822824974551769,
150
+ "loss": 1423.1790625,
151
+ "step": 600
152
+ },
153
+ {
154
+ "epoch": 0.6,
155
+ "eval_accuracy": 0.16569291338582678,
156
+ "eval_loss": 47.07837677001953,
157
+ "eval_runtime": 8.4354,
158
+ "eval_samples_per_second": 14.818,
159
+ "eval_steps_per_second": 1.897,
160
+ "step": 600
161
+ },
162
+ {
163
+ "epoch": 0.65,
164
+ "eval_accuracy": 0.16648031496062993,
165
+ "eval_loss": 47.00508117675781,
166
+ "eval_runtime": 10.7099,
167
+ "eval_samples_per_second": 11.671,
168
+ "eval_steps_per_second": 1.494,
169
+ "step": 650
170
+ },
171
+ {
172
+ "epoch": 0.7,
173
+ "grad_norm": 5090.822265625,
174
+ "learning_rate": 0.0001115146393893927,
175
+ "loss": 1419.58796875,
176
+ "step": 700
177
+ },
178
+ {
179
+ "epoch": 0.7,
180
+ "eval_accuracy": 0.16728346456692914,
181
+ "eval_loss": 46.935848236083984,
182
+ "eval_runtime": 8.4034,
183
+ "eval_samples_per_second": 14.875,
184
+ "eval_steps_per_second": 1.904,
185
+ "step": 700
186
+ },
187
+ {
188
+ "epoch": 0.75,
189
+ "eval_accuracy": 0.1675748031496063,
190
+ "eval_loss": 46.88325119018555,
191
+ "eval_runtime": 7.7053,
192
+ "eval_samples_per_second": 16.223,
193
+ "eval_steps_per_second": 2.076,
194
+ "step": 750
195
+ },
196
+ {
197
+ "epoch": 0.8,
198
+ "grad_norm": 8640.748046875,
199
+ "learning_rate": 5.269721958838045e-05,
200
+ "loss": 1415.78859375,
201
+ "step": 800
202
+ },
203
+ {
204
+ "epoch": 0.8,
205
+ "eval_accuracy": 0.1682755905511811,
206
+ "eval_loss": 46.84225845336914,
207
+ "eval_runtime": 8.5769,
208
+ "eval_samples_per_second": 14.574,
209
+ "eval_steps_per_second": 1.865,
210
+ "step": 800
211
+ },
212
+ {
213
+ "epoch": 0.85,
214
+ "eval_accuracy": 0.16845669291338583,
215
+ "eval_loss": 46.823673248291016,
216
+ "eval_runtime": 10.5888,
217
+ "eval_samples_per_second": 11.805,
218
+ "eval_steps_per_second": 1.511,
219
+ "step": 850
220
+ },
221
+ {
222
+ "epoch": 0.9,
223
+ "grad_norm": 14275.54296875,
224
+ "learning_rate": 1.3773856514840955e-05,
225
+ "loss": 1415.929375,
226
+ "step": 900
227
+ },
228
+ {
229
+ "epoch": 0.9,
230
+ "eval_accuracy": 0.1687007874015748,
231
+ "eval_loss": 46.804019927978516,
232
+ "eval_runtime": 8.7116,
233
+ "eval_samples_per_second": 14.349,
234
+ "eval_steps_per_second": 1.837,
235
+ "step": 900
236
+ },
237
+ {
238
+ "epoch": 0.95,
239
+ "eval_accuracy": 0.16866141732283466,
240
+ "eval_loss": 46.80295181274414,
241
+ "eval_runtime": 8.0554,
242
+ "eval_samples_per_second": 15.518,
243
+ "eval_steps_per_second": 1.986,
244
+ "step": 950
245
+ },
246
+ {
247
+ "epoch": 1.0,
248
+ "grad_norm": 11099.6376953125,
249
+ "learning_rate": 1.3660336561915898e-09,
250
+ "loss": 1415.8740625,
251
+ "step": 1000
252
+ },
253
+ {
254
+ "epoch": 1.0,
255
+ "eval_accuracy": 0.16873228346456692,
256
+ "eval_loss": 46.800193786621094,
257
+ "eval_runtime": 8.4996,
258
+ "eval_samples_per_second": 14.707,
259
+ "eval_steps_per_second": 1.882,
260
+ "step": 1000
261
  }
262
  ],
263
  "logging_steps": 100,
 
272
  "should_evaluate": false,
273
  "should_log": false,
274
  "should_save": true,
275
+ "should_training_stop": true
276
  },
277
  "attributes": {}
278
  }