CodeIsAbstract commited on
Commit
bff46a6
·
verified ·
1 Parent(s): 6296c90

Training in progress, step 600, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6bae43b52627ec635e8138665a3a76fb67c1c6817b62a6b5533adc30466d1216
3
  size 579748776
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0b60bd2b618a69841c9638940c605adda6c4341ba295b93f3a6e133859850d9b
3
  size 579748776
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4caadb553679cfc495bfa78dbf95efbd0038757efc70a680411a31a089ef9238
3
  size 1159627083
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f82169ccf1b0127e9b22314f600b128025f5b62090d5a9708b8fcba2a47577d6
3
  size 1159627083
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:02b94dfa6d7836c5c68f2d2549fc9be186c2691c198e846c097e4aae3ccf90e6
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b88b1c42229400fab90420f6e5c036d698ae72e0815465d44c9b14b967936d62
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a903f2c82e7b21fcfdd55b988513d1f4b97daf80c782473ccecc104f23b4dd7c
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a24f1bcbda0bf3e5430414e8c982c53ac11d90f165724ef0b93f5942d606b3a0
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:81bef68395366893911697d5372e508b6e708198d9017941b12c0581628d2a93
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4be5aafe091abf14e9046be44e4c580810411461427a26c13cdf5ca05ae54bc2
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.15,
6
  "eval_steps": 100,
7
- "global_step": 300,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -119,6 +119,117 @@
119
  "eval_samples_per_second": 64.571,
120
  "eval_steps_per_second": 2.13,
121
  "step": 300
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
122
  }
123
  ],
124
  "logging_steps": 25,
@@ -138,7 +249,7 @@
138
  "attributes": {}
139
  }
140
  },
141
- "total_flos": 2.006672071458816e+17,
142
  "train_batch_size": 64,
143
  "trial_name": null,
144
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.3,
6
  "eval_steps": 100,
7
+ "global_step": 600,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
119
  "eval_samples_per_second": 64.571,
120
  "eval_steps_per_second": 2.13,
121
  "step": 300
122
+ },
123
+ {
124
+ "epoch": 0.1625,
125
+ "grad_norm": 54.86927032470703,
126
+ "learning_rate": 9.783313076097283e-05,
127
+ "loss": 101.6082,
128
+ "step": 325
129
+ },
130
+ {
131
+ "epoch": 0.175,
132
+ "grad_norm": 14.090791702270508,
133
+ "learning_rate": 9.717209048767277e-05,
134
+ "loss": 100.8465,
135
+ "step": 350
136
+ },
137
+ {
138
+ "epoch": 0.1875,
139
+ "grad_norm": 42.630802154541016,
140
+ "learning_rate": 9.642604291892226e-05,
141
+ "loss": 99.9092,
142
+ "step": 375
143
+ },
144
+ {
145
+ "epoch": 0.2,
146
+ "grad_norm": 12.524935722351074,
147
+ "learning_rate": 9.559633248286604e-05,
148
+ "loss": 99.0524,
149
+ "step": 400
150
+ },
151
+ {
152
+ "epoch": 0.2,
153
+ "eval_accuracy": 0.15310791228876244,
154
+ "eval_loss": 6.214518070220947,
155
+ "eval_runtime": 7.3913,
156
+ "eval_samples_per_second": 65.618,
157
+ "eval_steps_per_second": 2.165,
158
+ "step": 400
159
+ },
160
+ {
161
+ "epoch": 0.2125,
162
+ "grad_norm": 22.39153480529785,
163
+ "learning_rate": 9.468445437379055e-05,
164
+ "loss": 98.4639,
165
+ "step": 425
166
+ },
167
+ {
168
+ "epoch": 0.225,
169
+ "grad_norm": 20.86402702331543,
170
+ "learning_rate": 9.369205185768272e-05,
171
+ "loss": 97.6668,
172
+ "step": 450
173
+ },
174
+ {
175
+ "epoch": 0.2375,
176
+ "grad_norm": 15.403814315795898,
177
+ "learning_rate": 9.262091331095375e-05,
178
+ "loss": 97.1439,
179
+ "step": 475
180
+ },
181
+ {
182
+ "epoch": 0.25,
183
+ "grad_norm": 18.481685638427734,
184
+ "learning_rate": 9.147296899766376e-05,
185
+ "loss": 96.6031,
186
+ "step": 500
187
+ },
188
+ {
189
+ "epoch": 0.25,
190
+ "eval_accuracy": 0.1584204706678313,
191
+ "eval_loss": 6.100996494293213,
192
+ "eval_runtime": 7.4101,
193
+ "eval_samples_per_second": 65.451,
194
+ "eval_steps_per_second": 2.159,
195
+ "step": 500
196
+ },
197
+ {
198
+ "epoch": 0.2625,
199
+ "grad_norm": 19.892127990722656,
200
+ "learning_rate": 9.025028759105558e-05,
201
+ "loss": 96.2492,
202
+ "step": 525
203
+ },
204
+ {
205
+ "epoch": 0.275,
206
+ "grad_norm": 20.713096618652344,
207
+ "learning_rate": 8.895507244566574e-05,
208
+ "loss": 96.3436,
209
+ "step": 550
210
+ },
211
+ {
212
+ "epoch": 0.2875,
213
+ "grad_norm": 12.466355323791504,
214
+ "learning_rate": 8.758965762673064e-05,
215
+ "loss": 96.5737,
216
+ "step": 575
217
+ },
218
+ {
219
+ "epoch": 0.3,
220
+ "grad_norm": 21.678146362304688,
221
+ "learning_rate": 8.615650370404327e-05,
222
+ "loss": 95.9314,
223
+ "step": 600
224
+ },
225
+ {
226
+ "epoch": 0.3,
227
+ "eval_accuracy": 0.163982449674087,
228
+ "eval_loss": 5.986855983734131,
229
+ "eval_runtime": 7.6235,
230
+ "eval_samples_per_second": 63.619,
231
+ "eval_steps_per_second": 2.099,
232
+ "step": 600
233
  }
234
  ],
235
  "logging_steps": 25,
 
249
  "attributes": {}
250
  }
251
  },
252
+ "total_flos": 4.013344142917632e+17,
253
  "train_batch_size": 64,
254
  "trial_name": null,
255
  "trial_params": null