firdavsus commited on
Commit
c7b53ed
·
verified ·
1 Parent(s): 4245422

Upload folder using huggingface_hub

Browse files
pytorch_model.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:151e238b1050a7ef0d0da3c36e3851a7f46b07f446691a0f3a18b7d515c62366
3
+ size 714062243
scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2ccf48dc42084ffe18c52ae49d2179afd087b4f3bab2c0e270a42273f69a8ce2
3
+ size 1465
special_tokens_map.json ADDED
@@ -0,0 +1,24 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token": {
3
+ "content": "<|endoftext|>",
4
+ "lstrip": false,
5
+ "normalized": false,
6
+ "rstrip": false,
7
+ "single_word": false
8
+ },
9
+ "eos_token": {
10
+ "content": "<|endoftext|>",
11
+ "lstrip": false,
12
+ "normalized": false,
13
+ "rstrip": false,
14
+ "single_word": false
15
+ },
16
+ "pad_token": "<|endoftext|>",
17
+ "unk_token": {
18
+ "content": "<|endoftext|>",
19
+ "lstrip": false,
20
+ "normalized": false,
21
+ "rstrip": false,
22
+ "single_word": false
23
+ }
24
+ }
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,212 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "added_tokens_decoder": {
4
+ "0": {
5
+ "content": "<|endoftext|>",
6
+ "lstrip": false,
7
+ "normalized": false,
8
+ "rstrip": false,
9
+ "single_word": false,
10
+ "special": true
11
+ },
12
+ "1": {
13
+ "content": "<|padding|>",
14
+ "lstrip": false,
15
+ "normalized": false,
16
+ "rstrip": false,
17
+ "single_word": false,
18
+ "special": true
19
+ },
20
+ "50254": {
21
+ "content": " ",
22
+ "lstrip": false,
23
+ "normalized": true,
24
+ "rstrip": false,
25
+ "single_word": false,
26
+ "special": false
27
+ },
28
+ "50255": {
29
+ "content": " ",
30
+ "lstrip": false,
31
+ "normalized": true,
32
+ "rstrip": false,
33
+ "single_word": false,
34
+ "special": false
35
+ },
36
+ "50256": {
37
+ "content": " ",
38
+ "lstrip": false,
39
+ "normalized": true,
40
+ "rstrip": false,
41
+ "single_word": false,
42
+ "special": false
43
+ },
44
+ "50257": {
45
+ "content": " ",
46
+ "lstrip": false,
47
+ "normalized": true,
48
+ "rstrip": false,
49
+ "single_word": false,
50
+ "special": false
51
+ },
52
+ "50258": {
53
+ "content": " ",
54
+ "lstrip": false,
55
+ "normalized": true,
56
+ "rstrip": false,
57
+ "single_word": false,
58
+ "special": false
59
+ },
60
+ "50259": {
61
+ "content": " ",
62
+ "lstrip": false,
63
+ "normalized": true,
64
+ "rstrip": false,
65
+ "single_word": false,
66
+ "special": false
67
+ },
68
+ "50260": {
69
+ "content": " ",
70
+ "lstrip": false,
71
+ "normalized": true,
72
+ "rstrip": false,
73
+ "single_word": false,
74
+ "special": false
75
+ },
76
+ "50261": {
77
+ "content": " ",
78
+ "lstrip": false,
79
+ "normalized": true,
80
+ "rstrip": false,
81
+ "single_word": false,
82
+ "special": false
83
+ },
84
+ "50262": {
85
+ "content": " ",
86
+ "lstrip": false,
87
+ "normalized": true,
88
+ "rstrip": false,
89
+ "single_word": false,
90
+ "special": false
91
+ },
92
+ "50263": {
93
+ "content": " ",
94
+ "lstrip": false,
95
+ "normalized": true,
96
+ "rstrip": false,
97
+ "single_word": false,
98
+ "special": false
99
+ },
100
+ "50264": {
101
+ "content": " ",
102
+ "lstrip": false,
103
+ "normalized": true,
104
+ "rstrip": false,
105
+ "single_word": false,
106
+ "special": false
107
+ },
108
+ "50265": {
109
+ "content": " ",
110
+ "lstrip": false,
111
+ "normalized": true,
112
+ "rstrip": false,
113
+ "single_word": false,
114
+ "special": false
115
+ },
116
+ "50266": {
117
+ "content": " ",
118
+ "lstrip": false,
119
+ "normalized": true,
120
+ "rstrip": false,
121
+ "single_word": false,
122
+ "special": false
123
+ },
124
+ "50267": {
125
+ "content": " ",
126
+ "lstrip": false,
127
+ "normalized": true,
128
+ "rstrip": false,
129
+ "single_word": false,
130
+ "special": false
131
+ },
132
+ "50268": {
133
+ "content": " ",
134
+ "lstrip": false,
135
+ "normalized": true,
136
+ "rstrip": false,
137
+ "single_word": false,
138
+ "special": false
139
+ },
140
+ "50269": {
141
+ "content": " ",
142
+ "lstrip": false,
143
+ "normalized": true,
144
+ "rstrip": false,
145
+ "single_word": false,
146
+ "special": false
147
+ },
148
+ "50270": {
149
+ "content": " ",
150
+ "lstrip": false,
151
+ "normalized": true,
152
+ "rstrip": false,
153
+ "single_word": false,
154
+ "special": false
155
+ },
156
+ "50271": {
157
+ "content": " ",
158
+ "lstrip": false,
159
+ "normalized": true,
160
+ "rstrip": false,
161
+ "single_word": false,
162
+ "special": false
163
+ },
164
+ "50272": {
165
+ "content": " ",
166
+ "lstrip": false,
167
+ "normalized": true,
168
+ "rstrip": false,
169
+ "single_word": false,
170
+ "special": false
171
+ },
172
+ "50273": {
173
+ "content": " ",
174
+ "lstrip": false,
175
+ "normalized": true,
176
+ "rstrip": false,
177
+ "single_word": false,
178
+ "special": false
179
+ },
180
+ "50274": {
181
+ "content": " ",
182
+ "lstrip": false,
183
+ "normalized": true,
184
+ "rstrip": false,
185
+ "single_word": false,
186
+ "special": false
187
+ },
188
+ "50275": {
189
+ "content": " ",
190
+ "lstrip": false,
191
+ "normalized": true,
192
+ "rstrip": false,
193
+ "single_word": false,
194
+ "special": false
195
+ },
196
+ "50276": {
197
+ "content": " ",
198
+ "lstrip": false,
199
+ "normalized": true,
200
+ "rstrip": false,
201
+ "single_word": false,
202
+ "special": false
203
+ }
204
+ },
205
+ "bos_token": "<|endoftext|>",
206
+ "clean_up_tokenization_spaces": true,
207
+ "eos_token": "<|endoftext|>",
208
+ "model_max_length": 1000000000000000019884624838656,
209
+ "pad_token": "<|endoftext|>",
210
+ "tokenizer_class": "GPTNeoXTokenizer",
211
+ "unk_token": "<|endoftext|>"
212
+ }
trainer_state.json ADDED
@@ -0,0 +1,761 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 6.357279084551812,
5
+ "eval_steps": 500,
6
+ "global_step": 2500,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.06,
13
+ "grad_norm": 1.6613423824310303,
14
+ "learning_rate": 6.361323155216286e-07,
15
+ "loss": 2.3639,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.13,
20
+ "grad_norm": 1.3924915790557861,
21
+ "learning_rate": 1.2722646310432571e-06,
22
+ "loss": 2.3559,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.19,
27
+ "grad_norm": 0.9411530494689941,
28
+ "learning_rate": 1.908396946564886e-06,
29
+ "loss": 2.3245,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 0.25,
34
+ "grad_norm": 0.7608889937400818,
35
+ "learning_rate": 2.5445292620865143e-06,
36
+ "loss": 2.2691,
37
+ "step": 100
38
+ },
39
+ {
40
+ "epoch": 0.32,
41
+ "grad_norm": 0.8099371790885925,
42
+ "learning_rate": 3.1806615776081427e-06,
43
+ "loss": 2.2409,
44
+ "step": 125
45
+ },
46
+ {
47
+ "epoch": 0.38,
48
+ "grad_norm": 0.6795283555984497,
49
+ "learning_rate": 3.816793893129772e-06,
50
+ "loss": 2.2435,
51
+ "step": 150
52
+ },
53
+ {
54
+ "epoch": 0.45,
55
+ "grad_norm": 0.6041733622550964,
56
+ "learning_rate": 4.4529262086514e-06,
57
+ "loss": 2.2375,
58
+ "step": 175
59
+ },
60
+ {
61
+ "epoch": 0.51,
62
+ "grad_norm": 0.644061803817749,
63
+ "learning_rate": 5.0890585241730285e-06,
64
+ "loss": 2.2012,
65
+ "step": 200
66
+ },
67
+ {
68
+ "epoch": 0.57,
69
+ "grad_norm": 0.6609583497047424,
70
+ "learning_rate": 5.725190839694656e-06,
71
+ "loss": 2.213,
72
+ "step": 225
73
+ },
74
+ {
75
+ "epoch": 0.64,
76
+ "grad_norm": 0.6314918994903564,
77
+ "learning_rate": 6.3613231552162854e-06,
78
+ "loss": 2.2088,
79
+ "step": 250
80
+ },
81
+ {
82
+ "epoch": 0.7,
83
+ "grad_norm": 0.6217303276062012,
84
+ "learning_rate": 6.997455470737914e-06,
85
+ "loss": 2.1823,
86
+ "step": 275
87
+ },
88
+ {
89
+ "epoch": 0.76,
90
+ "grad_norm": 0.624250054359436,
91
+ "learning_rate": 7.633587786259543e-06,
92
+ "loss": 2.1685,
93
+ "step": 300
94
+ },
95
+ {
96
+ "epoch": 0.83,
97
+ "grad_norm": 0.692873477935791,
98
+ "learning_rate": 8.26972010178117e-06,
99
+ "loss": 2.166,
100
+ "step": 325
101
+ },
102
+ {
103
+ "epoch": 0.89,
104
+ "grad_norm": 0.6286394000053406,
105
+ "learning_rate": 8.9058524173028e-06,
106
+ "loss": 2.1521,
107
+ "step": 350
108
+ },
109
+ {
110
+ "epoch": 0.95,
111
+ "grad_norm": 0.6370307803153992,
112
+ "learning_rate": 9.54198473282443e-06,
113
+ "loss": 2.149,
114
+ "step": 375
115
+ },
116
+ {
117
+ "epoch": 1.02,
118
+ "grad_norm": 0.614319384098053,
119
+ "learning_rate": 9.999903358354628e-06,
120
+ "loss": 2.1586,
121
+ "step": 400
122
+ },
123
+ {
124
+ "epoch": 1.08,
125
+ "grad_norm": 0.6239405274391174,
126
+ "learning_rate": 9.997980516292023e-06,
127
+ "loss": 2.1352,
128
+ "step": 425
129
+ },
130
+ {
131
+ "epoch": 1.14,
132
+ "grad_norm": 0.6648218631744385,
133
+ "learning_rate": 9.99359341519765e-06,
134
+ "loss": 2.1352,
135
+ "step": 450
136
+ },
137
+ {
138
+ "epoch": 1.21,
139
+ "grad_norm": 0.6202364563941956,
140
+ "learning_rate": 9.986744218135864e-06,
141
+ "loss": 2.1187,
142
+ "step": 475
143
+ },
144
+ {
145
+ "epoch": 1.27,
146
+ "grad_norm": 0.6447356939315796,
147
+ "learning_rate": 9.977436302109771e-06,
148
+ "loss": 2.1135,
149
+ "step": 500
150
+ },
151
+ {
152
+ "epoch": 1.27,
153
+ "eval_loss": 1.9783179759979248,
154
+ "eval_runtime": 2.6728,
155
+ "eval_samples_per_second": 187.071,
156
+ "eval_steps_per_second": 23.571,
157
+ "step": 500
158
+ },
159
+ {
160
+ "epoch": 1.34,
161
+ "grad_norm": 0.6953230500221252,
162
+ "learning_rate": 9.96567425639619e-06,
163
+ "loss": 2.1071,
164
+ "step": 525
165
+ },
166
+ {
167
+ "epoch": 1.4,
168
+ "grad_norm": 0.6353166103363037,
169
+ "learning_rate": 9.951463880282912e-06,
170
+ "loss": 2.109,
171
+ "step": 550
172
+ },
173
+ {
174
+ "epoch": 1.46,
175
+ "grad_norm": 0.5800075531005859,
176
+ "learning_rate": 9.93481218020935e-06,
177
+ "loss": 2.1165,
178
+ "step": 575
179
+ },
180
+ {
181
+ "epoch": 1.53,
182
+ "grad_norm": 0.6457290053367615,
183
+ "learning_rate": 9.915727366312012e-06,
184
+ "loss": 2.1009,
185
+ "step": 600
186
+ },
187
+ {
188
+ "epoch": 1.59,
189
+ "grad_norm": 0.5942001938819885,
190
+ "learning_rate": 9.894218848376482e-06,
191
+ "loss": 2.1133,
192
+ "step": 625
193
+ },
194
+ {
195
+ "epoch": 1.65,
196
+ "grad_norm": 0.6016191244125366,
197
+ "learning_rate": 9.870297231197922e-06,
198
+ "loss": 2.111,
199
+ "step": 650
200
+ },
201
+ {
202
+ "epoch": 1.72,
203
+ "grad_norm": 0.6793413758277893,
204
+ "learning_rate": 9.843974309352356e-06,
205
+ "loss": 2.0791,
206
+ "step": 675
207
+ },
208
+ {
209
+ "epoch": 1.78,
210
+ "grad_norm": 0.6286611557006836,
211
+ "learning_rate": 9.81526306138136e-06,
212
+ "loss": 2.1128,
213
+ "step": 700
214
+ },
215
+ {
216
+ "epoch": 1.84,
217
+ "grad_norm": 0.6072127223014832,
218
+ "learning_rate": 9.784177643392958e-06,
219
+ "loss": 2.0818,
220
+ "step": 725
221
+ },
222
+ {
223
+ "epoch": 1.91,
224
+ "grad_norm": 0.581510066986084,
225
+ "learning_rate": 9.750733382081965e-06,
226
+ "loss": 2.0686,
227
+ "step": 750
228
+ },
229
+ {
230
+ "epoch": 1.97,
231
+ "grad_norm": 0.607868492603302,
232
+ "learning_rate": 9.714946767173124e-06,
233
+ "loss": 2.0733,
234
+ "step": 775
235
+ },
236
+ {
237
+ "epoch": 2.03,
238
+ "grad_norm": 0.7183848023414612,
239
+ "learning_rate": 9.676835443290842e-06,
240
+ "loss": 2.0666,
241
+ "step": 800
242
+ },
243
+ {
244
+ "epoch": 2.1,
245
+ "grad_norm": 0.6486113667488098,
246
+ "learning_rate": 9.63641820125949e-06,
247
+ "loss": 2.0623,
248
+ "step": 825
249
+ },
250
+ {
251
+ "epoch": 2.16,
252
+ "grad_norm": 0.6377106308937073,
253
+ "learning_rate": 9.593714968838568e-06,
254
+ "loss": 2.0564,
255
+ "step": 850
256
+ },
257
+ {
258
+ "epoch": 2.23,
259
+ "grad_norm": 0.5825337171554565,
260
+ "learning_rate": 9.548746800897305e-06,
261
+ "loss": 2.0636,
262
+ "step": 875
263
+ },
264
+ {
265
+ "epoch": 2.29,
266
+ "grad_norm": 0.6640869975090027,
267
+ "learning_rate": 9.501535869033537e-06,
268
+ "loss": 2.0637,
269
+ "step": 900
270
+ },
271
+ {
272
+ "epoch": 2.35,
273
+ "grad_norm": 0.604284405708313,
274
+ "learning_rate": 9.452105450641974e-06,
275
+ "loss": 2.063,
276
+ "step": 925
277
+ },
278
+ {
279
+ "epoch": 2.42,
280
+ "grad_norm": 0.6545228362083435,
281
+ "learning_rate": 9.400479917437267e-06,
282
+ "loss": 2.0379,
283
+ "step": 950
284
+ },
285
+ {
286
+ "epoch": 2.48,
287
+ "grad_norm": 0.6467187404632568,
288
+ "learning_rate": 9.346684723437504e-06,
289
+ "loss": 2.0654,
290
+ "step": 975
291
+ },
292
+ {
293
+ "epoch": 2.54,
294
+ "grad_norm": 0.6103580594062805,
295
+ "learning_rate": 9.290746392414084e-06,
296
+ "loss": 2.0503,
297
+ "step": 1000
298
+ },
299
+ {
300
+ "epoch": 2.54,
301
+ "eval_loss": 1.9211387634277344,
302
+ "eval_runtime": 2.6351,
303
+ "eval_samples_per_second": 189.749,
304
+ "eval_steps_per_second": 23.908,
305
+ "step": 1000
306
+ },
307
+ {
308
+ "epoch": 2.61,
309
+ "grad_norm": 0.6254684329032898,
310
+ "learning_rate": 9.232692504814154e-06,
311
+ "loss": 2.0655,
312
+ "step": 1025
313
+ },
314
+ {
315
+ "epoch": 2.67,
316
+ "grad_norm": 0.6028435230255127,
317
+ "learning_rate": 9.172551684162025e-06,
318
+ "loss": 2.0678,
319
+ "step": 1050
320
+ },
321
+ {
322
+ "epoch": 2.73,
323
+ "grad_norm": 0.609348714351654,
324
+ "learning_rate": 9.110353582946341e-06,
325
+ "loss": 2.0406,
326
+ "step": 1075
327
+ },
328
+ {
329
+ "epoch": 2.8,
330
+ "grad_norm": 0.6535661816596985,
331
+ "learning_rate": 9.046128867999867e-06,
332
+ "loss": 2.072,
333
+ "step": 1100
334
+ },
335
+ {
336
+ "epoch": 2.86,
337
+ "grad_norm": 0.6350586414337158,
338
+ "learning_rate": 8.979909205379198e-06,
339
+ "loss": 2.0436,
340
+ "step": 1125
341
+ },
342
+ {
343
+ "epoch": 2.92,
344
+ "grad_norm": 0.6003224849700928,
345
+ "learning_rate": 8.911727244751763e-06,
346
+ "loss": 2.0428,
347
+ "step": 1150
348
+ },
349
+ {
350
+ "epoch": 2.99,
351
+ "grad_norm": 0.6171026825904846,
352
+ "learning_rate": 8.84161660329789e-06,
353
+ "loss": 2.0466,
354
+ "step": 1175
355
+ },
356
+ {
357
+ "epoch": 3.05,
358
+ "grad_norm": 0.6239070892333984,
359
+ "learning_rate": 8.76961184913581e-06,
360
+ "loss": 2.0201,
361
+ "step": 1200
362
+ },
363
+ {
364
+ "epoch": 3.12,
365
+ "grad_norm": 0.6221436858177185,
366
+ "learning_rate": 8.695748484277833e-06,
367
+ "loss": 2.0281,
368
+ "step": 1225
369
+ },
370
+ {
371
+ "epoch": 3.18,
372
+ "grad_norm": 0.6175958514213562,
373
+ "learning_rate": 8.620062927126021e-06,
374
+ "loss": 2.0472,
375
+ "step": 1250
376
+ },
377
+ {
378
+ "epoch": 3.24,
379
+ "grad_norm": 0.6366366147994995,
380
+ "learning_rate": 8.54259249451608e-06,
381
+ "loss": 2.0326,
382
+ "step": 1275
383
+ },
384
+ {
385
+ "epoch": 3.31,
386
+ "grad_norm": 0.6660250425338745,
387
+ "learning_rate": 8.463375383318254e-06,
388
+ "loss": 2.0263,
389
+ "step": 1300
390
+ },
391
+ {
392
+ "epoch": 3.37,
393
+ "grad_norm": 0.5739914178848267,
394
+ "learning_rate": 8.382450651604316e-06,
395
+ "loss": 2.0265,
396
+ "step": 1325
397
+ },
398
+ {
399
+ "epoch": 3.43,
400
+ "grad_norm": 0.6790344715118408,
401
+ "learning_rate": 8.29985819938996e-06,
402
+ "loss": 2.0219,
403
+ "step": 1350
404
+ },
405
+ {
406
+ "epoch": 3.5,
407
+ "grad_norm": 0.6223481893539429,
408
+ "learning_rate": 8.215638748962047e-06,
409
+ "loss": 1.9994,
410
+ "step": 1375
411
+ },
412
+ {
413
+ "epoch": 3.56,
414
+ "grad_norm": 0.5811251997947693,
415
+ "learning_rate": 8.129833824800453e-06,
416
+ "loss": 2.0206,
417
+ "step": 1400
418
+ },
419
+ {
420
+ "epoch": 3.62,
421
+ "grad_norm": 0.5943218469619751,
422
+ "learning_rate": 8.042485733104382e-06,
423
+ "loss": 2.0131,
424
+ "step": 1425
425
+ },
426
+ {
427
+ "epoch": 3.69,
428
+ "grad_norm": 0.595011293888092,
429
+ "learning_rate": 7.953637540933252e-06,
430
+ "loss": 2.0231,
431
+ "step": 1450
432
+ },
433
+ {
434
+ "epoch": 3.75,
435
+ "grad_norm": 0.7110486030578613,
436
+ "learning_rate": 7.863333054972443e-06,
437
+ "loss": 2.0297,
438
+ "step": 1475
439
+ },
440
+ {
441
+ "epoch": 3.81,
442
+ "grad_norm": 0.6503390073776245,
443
+ "learning_rate": 7.771616799934372e-06,
444
+ "loss": 2.0163,
445
+ "step": 1500
446
+ },
447
+ {
448
+ "epoch": 3.81,
449
+ "eval_loss": 1.8906679153442383,
450
+ "eval_runtime": 2.6486,
451
+ "eval_samples_per_second": 188.781,
452
+ "eval_steps_per_second": 23.786,
453
+ "step": 1500
454
+ },
455
+ {
456
+ "epoch": 3.88,
457
+ "grad_norm": 0.6919596791267395,
458
+ "learning_rate": 7.67853399660553e-06,
459
+ "loss": 2.0236,
460
+ "step": 1525
461
+ },
462
+ {
463
+ "epoch": 3.94,
464
+ "grad_norm": 0.6393699645996094,
465
+ "learning_rate": 7.584130539550348e-06,
466
+ "loss": 2.0241,
467
+ "step": 1550
468
+ },
469
+ {
470
+ "epoch": 4.01,
471
+ "grad_norm": 0.6010494232177734,
472
+ "learning_rate": 7.488452974482818e-06,
473
+ "loss": 2.0123,
474
+ "step": 1575
475
+ },
476
+ {
477
+ "epoch": 4.07,
478
+ "grad_norm": 0.6905403733253479,
479
+ "learning_rate": 7.3915484753171055e-06,
480
+ "loss": 2.0073,
481
+ "step": 1600
482
+ },
483
+ {
484
+ "epoch": 4.13,
485
+ "grad_norm": 0.6041144728660583,
486
+ "learning_rate": 7.293464820908392e-06,
487
+ "loss": 2.0118,
488
+ "step": 1625
489
+ },
490
+ {
491
+ "epoch": 4.2,
492
+ "grad_norm": 0.6558405756950378,
493
+ "learning_rate": 7.194250371495467e-06,
494
+ "loss": 2.0059,
495
+ "step": 1650
496
+ },
497
+ {
498
+ "epoch": 4.26,
499
+ "grad_norm": 0.6472019553184509,
500
+ "learning_rate": 7.093954044856674e-06,
501
+ "loss": 1.9895,
502
+ "step": 1675
503
+ },
504
+ {
505
+ "epoch": 4.32,
506
+ "grad_norm": 0.6358299255371094,
507
+ "learning_rate": 6.992625292190942e-06,
508
+ "loss": 1.9934,
509
+ "step": 1700
510
+ },
511
+ {
512
+ "epoch": 4.39,
513
+ "grad_norm": 0.828366219997406,
514
+ "learning_rate": 6.89031407373584e-06,
515
+ "loss": 2.0051,
516
+ "step": 1725
517
+ },
518
+ {
519
+ "epoch": 4.45,
520
+ "grad_norm": 0.5889772176742554,
521
+ "learning_rate": 6.787070834134618e-06,
522
+ "loss": 2.0057,
523
+ "step": 1750
524
+ },
525
+ {
526
+ "epoch": 4.51,
527
+ "grad_norm": 0.6443700790405273,
528
+ "learning_rate": 6.682946477564438e-06,
529
+ "loss": 1.9983,
530
+ "step": 1775
531
+ },
532
+ {
533
+ "epoch": 4.58,
534
+ "grad_norm": 0.6555039286613464,
535
+ "learning_rate": 6.57799234263802e-06,
536
+ "loss": 2.0049,
537
+ "step": 1800
538
+ },
539
+ {
540
+ "epoch": 4.64,
541
+ "grad_norm": 0.5760651230812073,
542
+ "learning_rate": 6.47226017709109e-06,
543
+ "loss": 1.9864,
544
+ "step": 1825
545
+ },
546
+ {
547
+ "epoch": 4.7,
548
+ "grad_norm": 0.6189552545547485,
549
+ "learning_rate": 6.365802112268104e-06,
550
+ "loss": 2.0114,
551
+ "step": 1850
552
+ },
553
+ {
554
+ "epoch": 4.77,
555
+ "grad_norm": 0.5847841501235962,
556
+ "learning_rate": 6.258670637418851e-06,
557
+ "loss": 1.9923,
558
+ "step": 1875
559
+ },
560
+ {
561
+ "epoch": 4.83,
562
+ "grad_norm": 0.5979297757148743,
563
+ "learning_rate": 6.150918573818569e-06,
564
+ "loss": 1.9992,
565
+ "step": 1900
566
+ },
567
+ {
568
+ "epoch": 4.9,
569
+ "grad_norm": 0.6612520813941956,
570
+ "learning_rate": 6.042599048724366e-06,
571
+ "loss": 2.0062,
572
+ "step": 1925
573
+ },
574
+ {
575
+ "epoch": 4.96,
576
+ "grad_norm": 0.6389756202697754,
577
+ "learning_rate": 5.933765469180779e-06,
578
+ "loss": 1.9897,
579
+ "step": 1950
580
+ },
581
+ {
582
+ "epoch": 5.02,
583
+ "grad_norm": 0.5569688081741333,
584
+ "learning_rate": 5.82447149568738e-06,
585
+ "loss": 1.9913,
586
+ "step": 1975
587
+ },
588
+ {
589
+ "epoch": 5.09,
590
+ "grad_norm": 0.6268473267555237,
591
+ "learning_rate": 5.714771015741414e-06,
592
+ "loss": 1.9881,
593
+ "step": 2000
594
+ },
595
+ {
596
+ "epoch": 5.09,
597
+ "eval_loss": 1.872865915298462,
598
+ "eval_runtime": 2.6614,
599
+ "eval_samples_per_second": 187.873,
600
+ "eval_steps_per_second": 23.672,
601
+ "step": 2000
602
+ },
603
+ {
604
+ "epoch": 5.15,
605
+ "grad_norm": 0.6172594428062439,
606
+ "learning_rate": 5.604718117268515e-06,
607
+ "loss": 1.9858,
608
+ "step": 2025
609
+ },
610
+ {
611
+ "epoch": 5.21,
612
+ "grad_norm": 0.6328703165054321,
613
+ "learning_rate": 5.494367061954609e-06,
614
+ "loss": 1.9934,
615
+ "step": 2050
616
+ },
617
+ {
618
+ "epoch": 5.28,
619
+ "grad_norm": 0.6563747525215149,
620
+ "learning_rate": 5.383772258492135e-06,
621
+ "loss": 1.9751,
622
+ "step": 2075
623
+ },
624
+ {
625
+ "epoch": 5.34,
626
+ "grad_norm": 0.5623390078544617,
627
+ "learning_rate": 5.2729882357537864e-06,
628
+ "loss": 1.9911,
629
+ "step": 2100
630
+ },
631
+ {
632
+ "epoch": 5.4,
633
+ "grad_norm": 0.5955666303634644,
634
+ "learning_rate": 5.162069615906998e-06,
635
+ "loss": 1.9852,
636
+ "step": 2125
637
+ },
638
+ {
639
+ "epoch": 5.47,
640
+ "grad_norm": 0.6157717108726501,
641
+ "learning_rate": 5.051071087482442e-06,
642
+ "loss": 1.967,
643
+ "step": 2150
644
+ },
645
+ {
646
+ "epoch": 5.53,
647
+ "grad_norm": 0.7150459289550781,
648
+ "learning_rate": 4.940047378409786e-06,
649
+ "loss": 1.9798,
650
+ "step": 2175
651
+ },
652
+ {
653
+ "epoch": 5.59,
654
+ "grad_norm": 0.5714321732521057,
655
+ "learning_rate": 4.829053229034043e-06,
656
+ "loss": 1.9864,
657
+ "step": 2200
658
+ },
659
+ {
660
+ "epoch": 5.66,
661
+ "grad_norm": 0.5759787559509277,
662
+ "learning_rate": 4.718143365125784e-06,
663
+ "loss": 1.9802,
664
+ "step": 2225
665
+ },
666
+ {
667
+ "epoch": 5.72,
668
+ "grad_norm": 0.6573282480239868,
669
+ "learning_rate": 4.6073724708985575e-06,
670
+ "loss": 1.9851,
671
+ "step": 2250
672
+ },
673
+ {
674
+ "epoch": 5.79,
675
+ "grad_norm": 0.6285906434059143,
676
+ "learning_rate": 4.496795162046774e-06,
677
+ "loss": 1.9794,
678
+ "step": 2275
679
+ },
680
+ {
681
+ "epoch": 5.85,
682
+ "grad_norm": 0.645057201385498,
683
+ "learning_rate": 4.386465958817396e-06,
684
+ "loss": 1.9776,
685
+ "step": 2300
686
+ },
687
+ {
688
+ "epoch": 5.91,
689
+ "grad_norm": 0.6082957983016968,
690
+ "learning_rate": 4.276439259128667e-06,
691
+ "loss": 1.987,
692
+ "step": 2325
693
+ },
694
+ {
695
+ "epoch": 5.98,
696
+ "grad_norm": 0.6126915216445923,
697
+ "learning_rate": 4.1667693117491784e-06,
698
+ "loss": 1.9837,
699
+ "step": 2350
700
+ },
701
+ {
702
+ "epoch": 6.04,
703
+ "grad_norm": 0.5728232860565186,
704
+ "learning_rate": 4.057510189550456e-06,
705
+ "loss": 1.9822,
706
+ "step": 2375
707
+ },
708
+ {
709
+ "epoch": 6.1,
710
+ "grad_norm": 0.6158954501152039,
711
+ "learning_rate": 3.9487157628462784e-06,
712
+ "loss": 1.9709,
713
+ "step": 2400
714
+ },
715
+ {
716
+ "epoch": 6.17,
717
+ "grad_norm": 0.5914610028266907,
718
+ "learning_rate": 3.840439672831872e-06,
719
+ "loss": 1.9841,
720
+ "step": 2425
721
+ },
722
+ {
723
+ "epoch": 6.23,
724
+ "grad_norm": 0.6070579290390015,
725
+ "learning_rate": 3.7327353051360703e-06,
726
+ "loss": 1.965,
727
+ "step": 2450
728
+ },
729
+ {
730
+ "epoch": 6.29,
731
+ "grad_norm": 0.6792969107627869,
732
+ "learning_rate": 3.625655763499467e-06,
733
+ "loss": 1.9792,
734
+ "step": 2475
735
+ },
736
+ {
737
+ "epoch": 6.36,
738
+ "grad_norm": 0.5990138053894043,
739
+ "learning_rate": 3.5192538435915834e-06,
740
+ "loss": 1.9739,
741
+ "step": 2500
742
+ },
743
+ {
744
+ "epoch": 6.36,
745
+ "eval_loss": 1.862921118736267,
746
+ "eval_runtime": 2.6134,
747
+ "eval_samples_per_second": 191.32,
748
+ "eval_steps_per_second": 24.106,
749
+ "step": 2500
750
+ }
751
+ ],
752
+ "logging_steps": 25,
753
+ "max_steps": 3930,
754
+ "num_input_tokens_seen": 0,
755
+ "num_train_epochs": 10,
756
+ "save_steps": 500,
757
+ "total_flos": 0.0,
758
+ "train_batch_size": 8,
759
+ "trial_name": null,
760
+ "trial_params": null
761
+ }
training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:eee975e6b9a502abdd36a9eacb349577b79673f9b562bbe7296c4ce27b56e32f
3
+ size 5329