CodeIsAbstract commited on
Commit
f2d83de
·
verified ·
1 Parent(s): 9ee624a

Training in progress, step 150, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:13ffc792f3d259993d089983addf06408c5d4168bb80ae4e93d9e27c88ac2002
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4a5404464e9bb484d34cf47867fbfeae189029cf7ff2bee8c63256927076502f
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:7a67906f8c7c9a7e76b55b46a0195852521231f190af25c50db78e7a42712a24
3
  size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7c832c15b463bb0902009acdb43bc55402abacb2120ea591b3d08765c6df315f
3
  size 1386414411
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:38fd2ee53c77ea2f7dbd66aca15b5e373033905c0f24009f095167575b44f3c3
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:58b61860000f270ef24d0bb03522991107ebd533901ca499cabb492a726a088a
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6633e86d4c67f74dfdd7f692c12dadf065f71b50d638c022301ad30cc5a4b374
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:04fab8fc2dd4bbc722b26708598a504e6b169355d93ff7b889697b9ea28dd82b
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4fda8308b847684d2c9f3c998b6decc82d851c5d48d991f8092b8612e3e1813b
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5cccf9bf3b3a85fdcc4a8781fe5c4acc7a0e94c949399f0bb52fbdd509f3aa7c
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,292 +2,49 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.5,
6
- "eval_steps": 200,
7
- "global_step": 1500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.016666666666666666,
14
- "grad_norm": 688.1050415039062,
15
- "learning_rate": 3.266666666666667e-05,
16
- "loss": 75.5622,
17
  "step": 50
18
  },
19
  {
20
- "epoch": 0.03333333333333333,
21
- "grad_norm": 2096.35986328125,
22
- "learning_rate": 6.6e-05,
23
- "loss": 72.8577,
24
  "step": 100
25
  },
26
  {
27
- "epoch": 0.05,
28
- "grad_norm": 9884.8369140625,
29
- "learning_rate": 9.933333333333334e-05,
30
- "loss": 72.1371,
31
  "step": 150
32
  },
33
- {
34
- "epoch": 0.06666666666666667,
35
- "grad_norm": 6535.71044921875,
36
- "learning_rate": 9.99270816881235e-05,
37
- "loss": 71.871,
38
- "step": 200
39
- },
40
- {
41
- "epoch": 0.06666666666666667,
42
- "eval_accuracy": 0.2704493860434324,
43
- "eval_loss": 4.5415215492248535,
44
- "eval_runtime": 7.9125,
45
- "eval_samples_per_second": 63.191,
46
- "eval_steps_per_second": 2.022,
47
- "step": 200
48
- },
49
- {
50
- "epoch": 0.08333333333333333,
51
- "grad_norm": 2549.314208984375,
52
- "learning_rate": 9.970256684745258e-05,
53
- "loss": 73.4509,
54
- "step": 250
55
- },
56
- {
57
- "epoch": 0.1,
58
- "grad_norm": 30061.046875,
59
- "learning_rate": 9.932710694482191e-05,
60
- "loss": 75.4218,
61
- "step": 300
62
- },
63
- {
64
- "epoch": 0.11666666666666667,
65
- "grad_norm": 48175.3359375,
66
- "learning_rate": 9.880184223961573e-05,
67
- "loss": 76.206,
68
- "step": 350
69
- },
70
- {
71
- "epoch": 0.13333333333333333,
72
- "grad_norm": 32999.78515625,
73
- "learning_rate": 9.812836794348004e-05,
74
- "loss": 76.8908,
75
- "step": 400
76
- },
77
- {
78
- "epoch": 0.13333333333333333,
79
- "eval_accuracy": 0.23184523867818646,
80
- "eval_loss": 4.965036869049072,
81
- "eval_runtime": 7.7766,
82
- "eval_samples_per_second": 64.296,
83
- "eval_steps_per_second": 2.057,
84
- "step": 400
85
- },
86
  {
87
  "epoch": 0.15,
88
- "grad_norm": 41767.6640625,
89
- "learning_rate": 9.730872937571739e-05,
90
- "loss": 76.9205,
91
- "step": 450
92
- },
93
- {
94
- "epoch": 0.16666666666666666,
95
- "grad_norm": 112764.3515625,
96
- "learning_rate": 9.634541575171929e-05,
97
- "loss": 77.5796,
98
- "step": 500
99
- },
100
- {
101
- "epoch": 0.18333333333333332,
102
- "grad_norm": 30660.970703125,
103
- "learning_rate": 9.524135262330098e-05,
104
- "loss": 77.067,
105
- "step": 550
106
- },
107
- {
108
- "epoch": 0.2,
109
- "grad_norm": 55290.8203125,
110
- "learning_rate": 9.399989299389661e-05,
111
- "loss": 75.4663,
112
- "step": 600
113
- },
114
- {
115
- "epoch": 0.2,
116
- "eval_accuracy": 0.24998188196442597,
117
- "eval_loss": 4.73757791519165,
118
- "eval_runtime": 8.0417,
119
- "eval_samples_per_second": 62.176,
120
- "eval_steps_per_second": 1.99,
121
- "step": 600
122
- },
123
- {
124
- "epoch": 0.21666666666666667,
125
- "grad_norm": 28325.5859375,
126
- "learning_rate": 9.262480713559808e-05,
127
- "loss": 76.2754,
128
- "step": 650
129
- },
130
- {
131
- "epoch": 0.23333333333333334,
132
- "grad_norm": 354199.03125,
133
- "learning_rate": 9.112027113896262e-05,
134
- "loss": 76.0095,
135
- "step": 700
136
- },
137
- {
138
- "epoch": 0.25,
139
- "grad_norm": 1301901.625,
140
- "learning_rate": 8.949085423036296e-05,
141
- "loss": 76.6464,
142
- "step": 750
143
- },
144
- {
145
- "epoch": 0.26666666666666666,
146
- "grad_norm": 118610.0,
147
- "learning_rate": 8.774150489539707e-05,
148
- "loss": 78.2808,
149
- "step": 800
150
- },
151
- {
152
- "epoch": 0.26666666666666666,
153
- "eval_accuracy": 0.22522578989738337,
154
- "eval_loss": 5.033573150634766,
155
- "eval_runtime": 7.5988,
156
- "eval_samples_per_second": 65.8,
157
- "eval_steps_per_second": 2.106,
158
- "step": 800
159
- },
160
- {
161
- "epoch": 0.2833333333333333,
162
- "grad_norm": 22132.029296875,
163
- "learning_rate": 8.587753585050004e-05,
164
- "loss": 79.5805,
165
- "step": 850
166
- },
167
- {
168
- "epoch": 0.3,
169
- "grad_norm": 10536.388671875,
170
- "learning_rate": 8.390460790839882e-05,
171
- "loss": 77.5871,
172
- "step": 900
173
- },
174
- {
175
- "epoch": 0.31666666666666665,
176
- "grad_norm": 15219.642578125,
177
- "learning_rate": 8.182871278641009e-05,
178
- "loss": 77.6208,
179
- "step": 950
180
- },
181
- {
182
- "epoch": 0.3333333333333333,
183
- "grad_norm": 92554.859375,
184
- "learning_rate": 7.965615490979163e-05,
185
- "loss": 78.9266,
186
- "step": 1000
187
- },
188
- {
189
- "epoch": 0.3333333333333333,
190
- "eval_accuracy": 0.2367096863914945,
191
- "eval_loss": 4.885761737823486,
192
- "eval_runtime": 7.9133,
193
- "eval_samples_per_second": 63.185,
194
- "eval_steps_per_second": 2.022,
195
- "step": 1000
196
- },
197
- {
198
- "epoch": 0.35,
199
- "grad_norm": 869790.875,
200
- "learning_rate": 7.739353226541009e-05,
201
- "loss": 78.3315,
202
- "step": 1050
203
- },
204
- {
205
- "epoch": 0.36666666666666664,
206
- "grad_norm": 131137.71875,
207
- "learning_rate": 7.504771636387163e-05,
208
- "loss": 79.5684,
209
- "step": 1100
210
- },
211
- {
212
- "epoch": 0.38333333333333336,
213
- "grad_norm": 188537.671875,
214
- "learning_rate": 7.262583137097018e-05,
215
- "loss": 79.0903,
216
- "step": 1150
217
- },
218
- {
219
- "epoch": 0.4,
220
- "grad_norm": 38120.7890625,
221
- "learning_rate": 7.013523247183e-05,
222
- "loss": 79.5616,
223
- "step": 1200
224
- },
225
- {
226
- "epoch": 0.4,
227
- "eval_accuracy": 0.2313888600523758,
228
- "eval_loss": 4.960353374481201,
229
- "eval_runtime": 7.869,
230
- "eval_samples_per_second": 63.54,
231
- "eval_steps_per_second": 2.033,
232
- "step": 1200
233
- },
234
- {
235
- "epoch": 0.4166666666666667,
236
- "grad_norm": 178847.84375,
237
- "learning_rate": 6.758348353345014e-05,
238
- "loss": 78.9412,
239
- "step": 1250
240
- },
241
- {
242
- "epoch": 0.43333333333333335,
243
- "grad_norm": 72944.7734375,
244
- "learning_rate": 6.497833413348909e-05,
245
- "loss": 78.9907,
246
- "step": 1300
247
- },
248
- {
249
- "epoch": 0.45,
250
- "grad_norm": 82608.953125,
251
- "learning_rate": 6.232769602505203e-05,
252
- "loss": 78.8287,
253
- "step": 1350
254
- },
255
- {
256
- "epoch": 0.4666666666666667,
257
- "grad_norm": 321814.40625,
258
- "learning_rate": 5.963961910895676e-05,
259
- "loss": 79.5967,
260
- "step": 1400
261
- },
262
- {
263
- "epoch": 0.4666666666666667,
264
- "eval_accuracy": 0.22584767922654594,
265
- "eval_loss": 5.036545753479004,
266
- "eval_runtime": 8.0524,
267
- "eval_samples_per_second": 62.094,
268
- "eval_steps_per_second": 1.987,
269
- "step": 1400
270
- },
271
- {
272
- "epoch": 0.48333333333333334,
273
- "grad_norm": 27832.90625,
274
- "learning_rate": 5.692226698644938e-05,
275
- "loss": 80.2996,
276
- "step": 1450
277
- },
278
- {
279
- "epoch": 0.5,
280
- "grad_norm": 165018.953125,
281
- "learning_rate": 5.418389216661579e-05,
282
- "loss": 82.4446,
283
- "step": 1500
284
  }
285
  ],
286
  "logging_steps": 50,
287
- "max_steps": 3000,
288
  "num_input_tokens_seen": 0,
289
  "num_train_epochs": 9223372036854775807,
290
- "save_steps": 500,
291
  "stateful_callbacks": {
292
  "TrainerControl": {
293
  "args": {
@@ -301,7 +58,7 @@
301
  }
302
  },
303
  "total_flos": 0.0,
304
- "train_batch_size": 16,
305
  "trial_name": null,
306
  "trial_params": null
307
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.15,
6
+ "eval_steps": 150,
7
+ "global_step": 150,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.05,
14
+ "grad_norm": 4757.10498046875,
15
+ "learning_rate": 3.2666666666666663e-07,
16
+ "loss": 74.4742,
17
  "step": 50
18
  },
19
  {
20
+ "epoch": 0.1,
21
+ "grad_norm": 15446.2177734375,
22
+ "learning_rate": 6.6e-07,
23
+ "loss": 74.3892,
24
  "step": 100
25
  },
26
  {
27
+ "epoch": 0.15,
28
+ "grad_norm": 6237.49609375,
29
+ "learning_rate": 9.933333333333333e-07,
30
+ "loss": 74.3298,
31
  "step": 150
32
  },
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
33
  {
34
  "epoch": 0.15,
35
+ "eval_accuracy": 0.25207497151999875,
36
+ "eval_loss": 4.663373947143555,
37
+ "eval_runtime": 6.2495,
38
+ "eval_samples_per_second": 80.007,
39
+ "eval_steps_per_second": 1.28,
40
+ "step": 150
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
41
  }
42
  ],
43
  "logging_steps": 50,
44
+ "max_steps": 1000,
45
  "num_input_tokens_seen": 0,
46
  "num_train_epochs": 9223372036854775807,
47
+ "save_steps": 150,
48
  "stateful_callbacks": {
49
  "TrainerControl": {
50
  "args": {
 
58
  }
59
  },
60
  "total_flos": 0.0,
61
+ "train_batch_size": 32,
62
  "trial_name": null,
63
  "trial_params": null
64
  }
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:986c335dce0a01e0698e3f66cfceb6465b40d305cc210f79ef029898df312e46
3
  size 5841
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9d40d24b46d3cd4d473941fc8d4a15b5795409810b25bec36748fef2488d6892
3
  size 5841