CodeIsAbstract commited on
Commit
a3adcd7
·
verified ·
1 Parent(s): ad78f36

Training in progress, step 50, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:217d3946b7803902022eec7cfd8fe9488050ab79dfd3fbe7b1875bbd6d1ae713
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0baf8aebd0d315fca0a75c5249758710a0ae88f24e69941b6c0dfa70d70a065b
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d3bd819f5f239a35fa547eccf498f447b392f7befceb13f93b74e1b0076ad315
3
  size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c6f89651ce6488a74e905c7535a0e9e4be29248063c5ce092a76f4964cc72d9e
3
  size 1386414411
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f0c3a7585079a88f7e60217509a0b7358c2fc795f19cc94faeed7068f7d0ce34
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3aa39656b4a39e592ac10990c9c5819213db01eda0c44a0561e566e469c0a6e7
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:692fc434e90b39dd1c760af3bb9bd206fa31fb36c8e62d4b9a61187caf62dd58
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:16b53619cb66bd690ba5e205b33c7d37deaa9bf03570e020bba1d0093af3aa44
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:055103685036cd172833dfba9d67c8c5638fe5ea929e5909dfadcb533f6d9014
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:47f0e4a0950d20841a2c1d04b40779122c778aedec691c8d056f034b68e3aedb
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,278 +2,134 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.14,
6
- "eval_steps": 5,
7
- "global_step": 140,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.005,
14
- "eval_accuracy": 0.05346666666666667,
15
- "eval_loss": 20.794218063354492,
16
- "eval_runtime": 35.3413,
17
- "eval_samples_per_second": 14.148,
18
- "eval_steps_per_second": 7.074,
19
  "step": 5
20
  },
21
  {
22
- "epoch": 0.01,
23
- "eval_accuracy": 0.07933333333333334,
24
- "eval_loss": 19.725038528442383,
25
- "eval_runtime": 35.9943,
26
- "eval_samples_per_second": 13.891,
27
- "eval_steps_per_second": 6.946,
28
  "step": 10
29
  },
30
  {
31
- "epoch": 0.015,
32
- "eval_accuracy": 0.087,
33
- "eval_loss": 18.806058883666992,
34
- "eval_runtime": 40.1906,
35
- "eval_samples_per_second": 12.441,
36
- "eval_steps_per_second": 6.22,
37
- "step": 15
38
- },
39
- {
40
- "epoch": 0.02,
41
- "eval_accuracy": 0.08553333333333334,
42
- "eval_loss": 18.3583984375,
43
- "eval_runtime": 36.0213,
44
- "eval_samples_per_second": 13.881,
45
- "eval_steps_per_second": 6.94,
46
- "step": 20
47
- },
48
- {
49
- "epoch": 0.025,
50
- "eval_accuracy": 0.08153333333333333,
51
- "eval_loss": 18.101879119873047,
52
- "eval_runtime": 41.6916,
53
- "eval_samples_per_second": 11.993,
54
- "eval_steps_per_second": 5.996,
55
- "step": 25
56
- },
57
- {
58
- "epoch": 0.03,
59
- "eval_accuracy": 0.07606666666666667,
60
- "eval_loss": 17.941076278686523,
61
- "eval_runtime": 36.7785,
62
- "eval_samples_per_second": 13.595,
63
- "eval_steps_per_second": 6.797,
64
- "step": 30
65
- },
66
- {
67
- "epoch": 0.035,
68
- "eval_accuracy": 0.08273333333333334,
69
- "eval_loss": 17.723947525024414,
70
- "eval_runtime": 40.5439,
71
- "eval_samples_per_second": 12.332,
72
- "eval_steps_per_second": 6.166,
73
- "step": 35
74
- },
75
- {
76
- "epoch": 0.04,
77
- "eval_accuracy": 0.08126666666666667,
78
- "eval_loss": 17.56175994873047,
79
- "eval_runtime": 35.5502,
80
- "eval_samples_per_second": 14.065,
81
- "eval_steps_per_second": 7.032,
82
- "step": 40
83
- },
84
- {
85
- "epoch": 0.045,
86
- "eval_accuracy": 0.08,
87
- "eval_loss": 17.587928771972656,
88
- "eval_runtime": 40.4006,
89
- "eval_samples_per_second": 12.376,
90
- "eval_steps_per_second": 6.188,
91
- "step": 45
92
- },
93
- {
94
- "epoch": 0.05,
95
- "eval_accuracy": 0.07426666666666666,
96
- "eval_loss": 17.396371841430664,
97
- "eval_runtime": 35.5138,
98
- "eval_samples_per_second": 14.079,
99
- "eval_steps_per_second": 7.04,
100
- "step": 50
101
- },
102
- {
103
- "epoch": 0.055,
104
- "eval_accuracy": 0.08266666666666667,
105
- "eval_loss": 17.291400909423828,
106
- "eval_runtime": 40.6248,
107
- "eval_samples_per_second": 12.308,
108
- "eval_steps_per_second": 6.154,
109
- "step": 55
110
- },
111
- {
112
- "epoch": 0.06,
113
- "eval_accuracy": 0.07613333333333333,
114
- "eval_loss": 17.195777893066406,
115
- "eval_runtime": 36.5259,
116
- "eval_samples_per_second": 13.689,
117
- "eval_steps_per_second": 6.844,
118
- "step": 60
119
- },
120
- {
121
- "epoch": 0.065,
122
- "eval_accuracy": 0.07053333333333334,
123
- "eval_loss": 17.156831741333008,
124
- "eval_runtime": 40.9838,
125
- "eval_samples_per_second": 12.2,
126
- "eval_steps_per_second": 6.1,
127
- "step": 65
128
- },
129
- {
130
- "epoch": 0.07,
131
- "eval_accuracy": 0.07253333333333334,
132
- "eval_loss": 17.09288215637207,
133
- "eval_runtime": 35.8052,
134
- "eval_samples_per_second": 13.964,
135
- "eval_steps_per_second": 6.982,
136
- "step": 70
137
- },
138
- {
139
- "epoch": 0.075,
140
- "eval_accuracy": 0.07566666666666666,
141
- "eval_loss": 17.033140182495117,
142
- "eval_runtime": 39.2943,
143
- "eval_samples_per_second": 12.725,
144
- "eval_steps_per_second": 6.362,
145
- "step": 75
146
- },
147
- {
148
- "epoch": 0.08,
149
- "eval_accuracy": 0.07093333333333333,
150
- "eval_loss": 16.976137161254883,
151
- "eval_runtime": 35.688,
152
- "eval_samples_per_second": 14.01,
153
- "eval_steps_per_second": 7.005,
154
- "step": 80
155
- },
156
- {
157
- "epoch": 0.085,
158
- "eval_accuracy": 0.0764,
159
- "eval_loss": 16.9167537689209,
160
- "eval_runtime": 40.3553,
161
- "eval_samples_per_second": 12.39,
162
- "eval_steps_per_second": 6.195,
163
- "step": 85
164
  },
165
  {
166
- "epoch": 0.09,
167
- "eval_accuracy": 0.0748,
168
- "eval_loss": 16.922040939331055,
169
- "eval_runtime": 36.0637,
170
- "eval_samples_per_second": 13.864,
171
- "eval_steps_per_second": 6.932,
172
- "step": 90
173
  },
174
  {
175
- "epoch": 0.095,
176
- "eval_accuracy": 0.06873333333333333,
177
- "eval_loss": 16.8882999420166,
178
- "eval_runtime": 40.7406,
179
- "eval_samples_per_second": 12.273,
180
- "eval_steps_per_second": 6.136,
181
- "step": 95
182
  },
183
  {
184
- "epoch": 0.1,
185
- "grad_norm": 3.5192229747772217,
186
- "learning_rate": 3.973800426880847e-06,
187
- "loss": 144.29556640625,
188
- "step": 100
 
 
189
  },
190
  {
191
- "epoch": 0.1,
192
- "eval_accuracy": 0.07646666666666667,
193
- "eval_loss": 16.831998825073242,
194
- "eval_runtime": 35.9838,
195
- "eval_samples_per_second": 13.895,
196
- "eval_steps_per_second": 6.948,
197
- "step": 100
198
  },
199
  {
200
- "epoch": 0.105,
201
- "eval_accuracy": 0.075,
202
- "eval_loss": 16.776647567749023,
203
- "eval_runtime": 40.0532,
204
- "eval_samples_per_second": 12.483,
205
- "eval_steps_per_second": 6.242,
206
- "step": 105
207
  },
208
  {
209
- "epoch": 0.11,
210
- "eval_accuracy": 0.07446666666666667,
211
- "eval_loss": 16.77096176147461,
212
- "eval_runtime": 35.8224,
213
- "eval_samples_per_second": 13.958,
214
- "eval_steps_per_second": 6.979,
215
- "step": 110
216
  },
217
  {
218
- "epoch": 0.115,
219
- "eval_accuracy": 0.07686666666666667,
220
- "eval_loss": 16.71495246887207,
221
- "eval_runtime": 40.5454,
222
- "eval_samples_per_second": 12.332,
223
- "eval_steps_per_second": 6.166,
224
- "step": 115
225
  },
226
  {
227
- "epoch": 0.12,
228
- "eval_accuracy": 0.07413333333333333,
229
- "eval_loss": 16.717641830444336,
230
- "eval_runtime": 34.8477,
231
- "eval_samples_per_second": 14.348,
232
- "eval_steps_per_second": 7.174,
233
- "step": 120
234
  },
235
  {
236
- "epoch": 0.125,
237
- "eval_accuracy": 0.0676,
238
- "eval_loss": 16.717758178710938,
239
- "eval_runtime": 39.1101,
240
- "eval_samples_per_second": 12.784,
241
- "eval_steps_per_second": 6.392,
242
- "step": 125
243
  },
244
  {
245
- "epoch": 0.13,
246
- "eval_accuracy": 0.07173333333333333,
247
- "eval_loss": 16.712247848510742,
248
- "eval_runtime": 35.0018,
249
- "eval_samples_per_second": 14.285,
250
- "eval_steps_per_second": 7.142,
251
- "step": 130
252
  },
253
  {
254
- "epoch": 0.135,
255
- "eval_accuracy": 0.0726,
256
- "eval_loss": 16.65378189086914,
257
- "eval_runtime": 39.4554,
258
- "eval_samples_per_second": 12.673,
259
- "eval_steps_per_second": 6.336,
260
- "step": 135
261
  },
262
  {
263
- "epoch": 0.14,
264
- "eval_accuracy": 0.0776,
265
- "eval_loss": 16.60840606689453,
266
- "eval_runtime": 35.1512,
267
- "eval_samples_per_second": 14.224,
268
- "eval_steps_per_second": 7.112,
269
- "step": 140
270
  }
271
  ],
272
- "logging_steps": 100,
273
- "max_steps": 1000,
274
  "num_input_tokens_seen": 0,
275
  "num_train_epochs": 9223372036854775807,
276
- "save_steps": 10,
277
  "stateful_callbacks": {
278
  "TrainerControl": {
279
  "args": {
@@ -287,7 +143,7 @@
287
  }
288
  },
289
  "total_flos": 0.0,
290
- "train_batch_size": 1,
291
  "trial_name": null,
292
  "trial_params": null
293
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.025,
6
+ "eval_steps": 10,
7
+ "global_step": 50,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.0025,
14
+ "grad_norm": 7.581125259399414,
15
+ "learning_rate": 1.6e-07,
16
+ "loss": 86.44205322265626,
 
 
17
  "step": 5
18
  },
19
  {
20
+ "epoch": 0.005,
21
+ "grad_norm": 870.7899169921875,
22
+ "learning_rate": 3.6e-07,
23
+ "loss": 305.9718505859375,
 
 
24
  "step": 10
25
  },
26
  {
27
+ "epoch": 0.005,
28
+ "eval_accuracy": 0.029019607843137254,
29
+ "eval_loss": 68.04701232910156,
30
+ "eval_runtime": 35.4394,
31
+ "eval_samples_per_second": 14.109,
32
+ "eval_steps_per_second": 1.778,
33
+ "step": 10
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
34
  },
35
  {
36
+ "epoch": 0.0075,
37
+ "grad_norm": 225.20162963867188,
38
+ "learning_rate": 5.6e-07,
39
+ "loss": 179.27216796875,
40
+ "step": 15
 
 
41
  },
42
  {
43
+ "epoch": 0.01,
44
+ "grad_norm": 79.13408660888672,
45
+ "learning_rate": 7.599999999999999e-07,
46
+ "loss": 130.82646484375,
47
+ "step": 20
 
 
48
  },
49
  {
50
+ "epoch": 0.01,
51
+ "eval_accuracy": 0.02961176470588235,
52
+ "eval_loss": 31.59725570678711,
53
+ "eval_runtime": 36.9264,
54
+ "eval_samples_per_second": 13.54,
55
+ "eval_steps_per_second": 1.706,
56
+ "step": 20
57
  },
58
  {
59
+ "epoch": 0.0125,
60
+ "grad_norm": 72.2133560180664,
61
+ "learning_rate": 9.6e-07,
62
+ "loss": 124.6850830078125,
63
+ "step": 25
 
 
64
  },
65
  {
66
+ "epoch": 0.015,
67
+ "grad_norm": 94.8714828491211,
68
+ "learning_rate": 1.16e-06,
69
+ "loss": 123.9353515625,
70
+ "step": 30
 
 
71
  },
72
  {
73
+ "epoch": 0.015,
74
+ "eval_accuracy": 0.04030196078431372,
75
+ "eval_loss": 30.649425506591797,
76
+ "eval_runtime": 38.2598,
77
+ "eval_samples_per_second": 13.069,
78
+ "eval_steps_per_second": 1.647,
79
+ "step": 30
80
  },
81
  {
82
+ "epoch": 0.0175,
83
+ "grad_norm": 54.928829193115234,
84
+ "learning_rate": 1.3600000000000001e-06,
85
+ "loss": 125.992138671875,
86
+ "step": 35
 
 
87
  },
88
  {
89
+ "epoch": 0.02,
90
+ "grad_norm": 70.58757019042969,
91
+ "learning_rate": 1.5599999999999999e-06,
92
+ "loss": 120.77716064453125,
93
+ "step": 40
 
 
94
  },
95
  {
96
+ "epoch": 0.02,
97
+ "eval_accuracy": 0.04015686274509804,
98
+ "eval_loss": 29.560930252075195,
99
+ "eval_runtime": 37.9793,
100
+ "eval_samples_per_second": 13.165,
101
+ "eval_steps_per_second": 1.659,
102
+ "step": 40
103
  },
104
  {
105
+ "epoch": 0.0225,
106
+ "grad_norm": 81.62490844726562,
107
+ "learning_rate": 1.7599999999999999e-06,
108
+ "loss": 121.851220703125,
109
+ "step": 45
 
 
110
  },
111
  {
112
+ "epoch": 0.025,
113
+ "grad_norm": 65.93287658691406,
114
+ "learning_rate": 1.96e-06,
115
+ "loss": 120.95302734375,
116
+ "step": 50
 
 
117
  },
118
  {
119
+ "epoch": 0.025,
120
+ "eval_accuracy": 0.04131764705882353,
121
+ "eval_loss": 28.05109977722168,
122
+ "eval_runtime": 38.147,
123
+ "eval_samples_per_second": 13.107,
124
+ "eval_steps_per_second": 1.652,
125
+ "step": 50
126
  }
127
  ],
128
+ "logging_steps": 5,
129
+ "max_steps": 2000,
130
  "num_input_tokens_seen": 0,
131
  "num_train_epochs": 9223372036854775807,
132
+ "save_steps": 50,
133
  "stateful_callbacks": {
134
  "TrainerControl": {
135
  "args": {
 
143
  }
144
  },
145
  "total_flos": 0.0,
146
+ "train_batch_size": 4,
147
  "trial_name": null,
148
  "trial_params": null
149
  }
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9bdaf07830b33937d6f32edfcc276b67b7d1e1e7aade843e68aded14ec567bf9
3
  size 5265
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:57ed8b4eb49e711b8df54cadbcace7d2d15a05286403e857af5f3e540c8ca416
3
  size 5265