CodeIsAbstract commited on
Commit
81f94d2
·
verified ·
1 Parent(s): a52b33c

Training in progress, step 300, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0baf8aebd0d315fca0a75c5249758710a0ae88f24e69941b6c0dfa70d70a065b
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f2a195bb2affd8b92355b3c3fbcdcbd8a8755d76f59c56edd91c1c227737ee85
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c6f89651ce6488a74e905c7535a0e9e4be29248063c5ce092a76f4964cc72d9e
3
  size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c3e72953437bdac655e896c21e48e0325851505cdf5c9e67ff62fe154ccbd5a6
3
  size 1386414411
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3aa39656b4a39e592ac10990c9c5819213db01eda0c44a0561e566e469c0a6e7
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7b33358d13198554488bc16b3454035cd57e8325ffb080d0773f728d9e98a2a6
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:16b53619cb66bd690ba5e205b33c7d37deaa9bf03570e020bba1d0093af3aa44
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4be3090ef898425f736ce392d528a5e318dff0385f66de485a25e7ee90ff9432
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:47f0e4a0950d20841a2c1d04b40779122c778aedec691c8d056f034b68e3aedb
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3b622a9357894e5e2498db0562bf753e1b98ac7c3a28c1715b2965db7bdcc60b
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,134 +2,247 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.025,
6
- "eval_steps": 10,
7
- "global_step": 50,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.0025,
14
- "grad_norm": 7.581125259399414,
15
- "learning_rate": 1.6e-07,
16
- "loss": 86.44205322265626,
17
- "step": 5
18
  },
19
  {
20
- "epoch": 0.005,
21
- "grad_norm": 870.7899169921875,
22
- "learning_rate": 3.6e-07,
23
- "loss": 305.9718505859375,
24
- "step": 10
25
  },
26
  {
27
- "epoch": 0.005,
28
- "eval_accuracy": 0.029019607843137254,
29
- "eval_loss": 68.04701232910156,
30
- "eval_runtime": 35.4394,
31
- "eval_samples_per_second": 14.109,
32
- "eval_steps_per_second": 1.778,
33
- "step": 10
34
  },
35
  {
36
- "epoch": 0.0075,
37
- "grad_norm": 225.20162963867188,
38
- "learning_rate": 5.6e-07,
39
- "loss": 179.27216796875,
40
- "step": 15
41
  },
42
  {
43
- "epoch": 0.01,
44
- "grad_norm": 79.13408660888672,
45
- "learning_rate": 7.599999999999999e-07,
46
- "loss": 130.82646484375,
47
- "step": 20
48
  },
49
  {
50
- "epoch": 0.01,
51
- "eval_accuracy": 0.02961176470588235,
52
- "eval_loss": 31.59725570678711,
53
- "eval_runtime": 36.9264,
54
- "eval_samples_per_second": 13.54,
55
- "eval_steps_per_second": 1.706,
56
- "step": 20
57
  },
58
  {
59
- "epoch": 0.0125,
60
- "grad_norm": 72.2133560180664,
61
- "learning_rate": 9.6e-07,
62
- "loss": 124.6850830078125,
63
- "step": 25
64
  },
65
  {
66
- "epoch": 0.015,
67
- "grad_norm": 94.8714828491211,
68
- "learning_rate": 1.16e-06,
69
- "loss": 123.9353515625,
70
- "step": 30
71
  },
72
  {
73
- "epoch": 0.015,
74
- "eval_accuracy": 0.04030196078431372,
75
- "eval_loss": 30.649425506591797,
76
- "eval_runtime": 38.2598,
77
- "eval_samples_per_second": 13.069,
78
- "eval_steps_per_second": 1.647,
79
- "step": 30
80
  },
81
  {
82
- "epoch": 0.0175,
83
- "grad_norm": 54.928829193115234,
84
- "learning_rate": 1.3600000000000001e-06,
85
- "loss": 125.992138671875,
86
- "step": 35
87
  },
88
  {
89
- "epoch": 0.02,
90
- "grad_norm": 70.58757019042969,
91
- "learning_rate": 1.5599999999999999e-06,
92
- "loss": 120.77716064453125,
93
- "step": 40
94
  },
95
  {
96
- "epoch": 0.02,
97
- "eval_accuracy": 0.04015686274509804,
98
- "eval_loss": 29.560930252075195,
99
- "eval_runtime": 37.9793,
100
- "eval_samples_per_second": 13.165,
101
- "eval_steps_per_second": 1.659,
102
- "step": 40
103
  },
104
  {
105
- "epoch": 0.0225,
106
- "grad_norm": 81.62490844726562,
107
- "learning_rate": 1.7599999999999999e-06,
108
- "loss": 121.851220703125,
109
- "step": 45
110
  },
111
  {
112
- "epoch": 0.025,
113
- "grad_norm": 65.93287658691406,
114
- "learning_rate": 1.96e-06,
115
- "loss": 120.95302734375,
116
- "step": 50
117
  },
118
  {
119
- "epoch": 0.025,
120
- "eval_accuracy": 0.04131764705882353,
121
- "eval_loss": 28.05109977722168,
122
- "eval_runtime": 38.147,
123
- "eval_samples_per_second": 13.107,
124
- "eval_steps_per_second": 1.652,
125
- "step": 50
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
126
  }
127
  ],
128
- "logging_steps": 5,
129
- "max_steps": 2000,
130
  "num_input_tokens_seen": 0,
131
  "num_train_epochs": 9223372036854775807,
132
- "save_steps": 50,
133
  "stateful_callbacks": {
134
  "TrainerControl": {
135
  "args": {
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.14285714285714285,
6
+ "eval_steps": 150,
7
+ "global_step": 300,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.004761904761904762,
14
+ "grad_norm": 138.4115447998047,
15
+ "learning_rate": 3.4285714285714286e-07,
16
+ "loss": 40.940005493164065,
17
+ "step": 10
18
  },
19
  {
20
+ "epoch": 0.009523809523809525,
21
+ "grad_norm": 137.81439208984375,
22
+ "learning_rate": 7.238095238095238e-07,
23
+ "loss": 60.1491455078125,
24
+ "step": 20
25
  },
26
  {
27
+ "epoch": 0.014285714285714285,
28
+ "grad_norm": 66.88855743408203,
29
+ "learning_rate": 1.1047619047619047e-06,
30
+ "loss": 41.3765869140625,
31
+ "step": 30
 
 
32
  },
33
  {
34
+ "epoch": 0.01904761904761905,
35
+ "grad_norm": 61.619834899902344,
36
+ "learning_rate": 1.4857142857142858e-06,
37
+ "loss": 37.01522216796875,
38
+ "step": 40
39
  },
40
  {
41
+ "epoch": 0.023809523809523808,
42
+ "grad_norm": 103.27572631835938,
43
+ "learning_rate": 1.8666666666666667e-06,
44
+ "loss": 33.547723388671876,
45
+ "step": 50
46
  },
47
  {
48
+ "epoch": 0.02857142857142857,
49
+ "grad_norm": 70.52592468261719,
50
+ "learning_rate": 2.2476190476190477e-06,
51
+ "loss": 33.890313720703126,
52
+ "step": 60
 
 
53
  },
54
  {
55
+ "epoch": 0.03333333333333333,
56
+ "grad_norm": 32.40092086791992,
57
+ "learning_rate": 2.6285714285714286e-06,
58
+ "loss": 32.475531005859374,
59
+ "step": 70
60
  },
61
  {
62
+ "epoch": 0.0380952380952381,
63
+ "grad_norm": 48.953285217285156,
64
+ "learning_rate": 3.0095238095238094e-06,
65
+ "loss": 31.98614501953125,
66
+ "step": 80
67
  },
68
  {
69
+ "epoch": 0.04285714285714286,
70
+ "grad_norm": 79.75335693359375,
71
+ "learning_rate": 3.3904761904761903e-06,
72
+ "loss": 30.443341064453126,
73
+ "step": 90
 
 
74
  },
75
  {
76
+ "epoch": 0.047619047619047616,
77
+ "grad_norm": 58.47705841064453,
78
+ "learning_rate": 3.771428571428571e-06,
79
+ "loss": 32.29954833984375,
80
+ "step": 100
81
  },
82
  {
83
+ "epoch": 0.05238095238095238,
84
+ "grad_norm": 33.17606735229492,
85
+ "learning_rate": 3.999960323578798e-06,
86
+ "loss": 32.247186279296876,
87
+ "step": 110
88
  },
89
  {
90
+ "epoch": 0.05714285714285714,
91
+ "grad_norm": 40.67790985107422,
92
+ "learning_rate": 3.999513981918989e-06,
93
+ "loss": 32.20079040527344,
94
+ "step": 120
 
 
95
  },
96
  {
97
+ "epoch": 0.06190476190476191,
98
+ "grad_norm": 45.4234619140625,
99
+ "learning_rate": 3.998571814122654e-06,
100
+ "loss": 30.031964111328126,
101
+ "step": 130
102
  },
103
  {
104
+ "epoch": 0.06666666666666667,
105
+ "grad_norm": 60.951908111572266,
106
+ "learning_rate": 3.997134053822277e-06,
107
+ "loss": 29.55460205078125,
108
+ "step": 140
109
  },
110
  {
111
+ "epoch": 0.07142857142857142,
112
+ "grad_norm": 63.76414489746094,
113
+ "learning_rate": 3.995201057544064e-06,
114
+ "loss": 28.688177490234374,
115
+ "step": 150
116
+ },
117
+ {
118
+ "epoch": 0.07142857142857142,
119
+ "eval_accuracy": 0.043283464566929136,
120
+ "eval_loss": 27.93197250366211,
121
+ "eval_runtime": 24.8513,
122
+ "eval_samples_per_second": 20.12,
123
+ "eval_steps_per_second": 2.535,
124
+ "step": 150
125
+ },
126
+ {
127
+ "epoch": 0.0761904761904762,
128
+ "grad_norm": 55.72420120239258,
129
+ "learning_rate": 3.992773304619536e-06,
130
+ "loss": 27.05469970703125,
131
+ "step": 160
132
+ },
133
+ {
134
+ "epoch": 0.08095238095238096,
135
+ "grad_norm": 41.70425796508789,
136
+ "learning_rate": 3.989851397066665e-06,
137
+ "loss": 26.17386474609375,
138
+ "step": 170
139
+ },
140
+ {
141
+ "epoch": 0.08571428571428572,
142
+ "grad_norm": 41.78767776489258,
143
+ "learning_rate": 3.98643605944059e-06,
144
+ "loss": 26.51021728515625,
145
+ "step": 180
146
+ },
147
+ {
148
+ "epoch": 0.09047619047619047,
149
+ "grad_norm": 50.67561721801758,
150
+ "learning_rate": 3.98252813865395e-06,
151
+ "loss": 26.913729858398437,
152
+ "step": 190
153
+ },
154
+ {
155
+ "epoch": 0.09523809523809523,
156
+ "grad_norm": 57.547393798828125,
157
+ "learning_rate": 3.978128603766867e-06,
158
+ "loss": 25.517425537109375,
159
+ "step": 200
160
+ },
161
+ {
162
+ "epoch": 0.1,
163
+ "grad_norm": 26.557636260986328,
164
+ "learning_rate": 3.97323854574665e-06,
165
+ "loss": 24.818318176269532,
166
+ "step": 210
167
+ },
168
+ {
169
+ "epoch": 0.10476190476190476,
170
+ "grad_norm": 45.89893341064453,
171
+ "learning_rate": 3.967859177197259e-06,
172
+ "loss": 24.499539184570313,
173
+ "step": 220
174
+ },
175
+ {
176
+ "epoch": 0.10952380952380952,
177
+ "grad_norm": 76.51309967041016,
178
+ "learning_rate": 3.961991832058617e-06,
179
+ "loss": 23.831640625,
180
+ "step": 230
181
+ },
182
+ {
183
+ "epoch": 0.11428571428571428,
184
+ "grad_norm": 36.89082336425781,
185
+ "learning_rate": 3.955637965275824e-06,
186
+ "loss": 23.571630859375,
187
+ "step": 240
188
+ },
189
+ {
190
+ "epoch": 0.11904761904761904,
191
+ "grad_norm": 19.28327751159668,
192
+ "learning_rate": 3.948799152438371e-06,
193
+ "loss": 22.825534057617187,
194
+ "step": 250
195
+ },
196
+ {
197
+ "epoch": 0.12380952380952381,
198
+ "grad_norm": 30.663532257080078,
199
+ "learning_rate": 3.941477089389439e-06,
200
+ "loss": 22.282626342773437,
201
+ "step": 260
202
+ },
203
+ {
204
+ "epoch": 0.12857142857142856,
205
+ "grad_norm": 60.91099548339844,
206
+ "learning_rate": 3.9336735918053705e-06,
207
+ "loss": 22.1782470703125,
208
+ "step": 270
209
+ },
210
+ {
211
+ "epoch": 0.13333333333333333,
212
+ "grad_norm": 68.26007843017578,
213
+ "learning_rate": 3.92539059474543e-06,
214
+ "loss": 22.209671020507812,
215
+ "step": 280
216
+ },
217
+ {
218
+ "epoch": 0.1380952380952381,
219
+ "grad_norm": 24.719745635986328,
220
+ "learning_rate": 3.916630152171965e-06,
221
+ "loss": 21.11513671875,
222
+ "step": 290
223
+ },
224
+ {
225
+ "epoch": 0.14285714285714285,
226
+ "grad_norm": 45.6879768371582,
227
+ "learning_rate": 3.907394436441075e-06,
228
+ "loss": 21.380886840820313,
229
+ "step": 300
230
+ },
231
+ {
232
+ "epoch": 0.14285714285714285,
233
+ "eval_accuracy": 0.04578740157480315,
234
+ "eval_loss": 21.396591186523438,
235
+ "eval_runtime": 25.9922,
236
+ "eval_samples_per_second": 19.237,
237
+ "eval_steps_per_second": 2.424,
238
+ "step": 300
239
  }
240
  ],
241
+ "logging_steps": 10,
242
+ "max_steps": 2100,
243
  "num_input_tokens_seen": 0,
244
  "num_train_epochs": 9223372036854775807,
245
+ "save_steps": 300,
246
  "stateful_callbacks": {
247
  "TrainerControl": {
248
  "args": {
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:57ed8b4eb49e711b8df54cadbcace7d2d15a05286403e857af5f3e540c8ca416
3
  size 5265
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:955e9774b2244b558ea3df34c7a124fc378c4653e356f16cd2ed5c5d4fa98f89
3
  size 5265