classicmaster commited on
Commit
91381ca
·
verified ·
1 Parent(s): 44d9fe3

Upload folder using huggingface_hub

Browse files
checkpoint-step-1200/adapter_config.json CHANGED
@@ -34,13 +34,13 @@
34
  "rank_pattern": {},
35
  "revision": null,
36
  "target_modules": [
 
 
37
  "v_proj",
38
  "down_proj",
39
  "o_proj",
40
- "q_proj",
41
  "up_proj",
42
- "gate_proj",
43
- "k_proj"
44
  ],
45
  "target_parameters": null,
46
  "task_type": "CAUSAL_LM",
 
34
  "rank_pattern": {},
35
  "revision": null,
36
  "target_modules": [
37
+ "gate_proj",
38
+ "k_proj",
39
  "v_proj",
40
  "down_proj",
41
  "o_proj",
 
42
  "up_proj",
43
+ "q_proj"
 
44
  ],
45
  "target_parameters": null,
46
  "task_type": "CAUSAL_LM",
checkpoint-step-1200/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6a0638027abedc4c2269d44ea45c717c23688c734781360cd8f356e2b58856cf
3
  size 239536272
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:53364c92578b73ee024ed722471a475ab20e95a9d865269c30543abcfec994f8
3
  size 239536272
checkpoint-step-1200/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0607d696320cbb9c966684bce0a7e12f4cd6504d1754719140d4088458e0d6ed
3
  size 122203333
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8fd70155a7042c6f2348e03114ba317896403d65ad528fb3b5e6d2e45a9674f3
3
  size 122203333
checkpoint-step-1200/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5ec619f50d6dc085f5fa346c2e7bad8f96ad5b3bb7557c76b686b76aaf1c3509
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b9466d2afca7fd6124ef1c1eb08fe1d29700db0d98947cd5aaae851b7a15434c
3
  size 1465
checkpoint-step-1200/tokenizer_config.json CHANGED
@@ -5,7 +5,7 @@
5
  "clean_up_tokenization_spaces": false,
6
  "eos_token": "<|endoftext|>",
7
  "errors": "replace",
8
- "is_local": false,
9
  "model_max_length": 32768,
10
  "pad_token": "<|PAD_TOKEN|>",
11
  "padding_side": "right",
 
5
  "clean_up_tokenization_spaces": false,
6
  "eos_token": "<|endoftext|>",
7
  "errors": "replace",
8
+ "is_local": true,
9
  "model_max_length": 32768,
10
  "pad_token": "<|PAD_TOKEN|>",
11
  "padding_side": "right",
checkpoint-step-1200/trainer_state.json CHANGED
@@ -1,7 +1,7 @@
1
  {
2
- "best_global_step": 1000,
3
- "best_metric": 0.9810675382614136,
4
- "best_model_checkpoint": "./outputs/checkpoint-1000",
5
  "epoch": 2.255639097744361,
6
  "eval_steps": 100,
7
  "global_step": 1200,
@@ -11,273 +11,273 @@
11
  "log_history": [
12
  {
13
  "epoch": 0.09398496240601503,
14
- "grad_norm": 0.49556756019592285,
15
  "learning_rate": 9.8e-05,
16
- "loss": 1.8540109252929688,
17
  "step": 50
18
  },
19
  {
20
  "epoch": 0.18796992481203006,
21
- "grad_norm": 0.4922962486743927,
22
- "learning_rate": 9.907020872865275e-05,
23
- "loss": 1.2944253540039063,
24
  "step": 100
25
  },
26
  {
27
  "epoch": 0.18796992481203006,
28
- "eval_loss": 1.216850757598877,
29
- "eval_runtime": 83.4733,
30
- "eval_samples_per_second": 5.666,
31
- "eval_steps_per_second": 1.426,
32
  "step": 100
33
  },
34
  {
35
  "epoch": 0.2819548872180451,
36
- "grad_norm": 0.5891006588935852,
37
- "learning_rate": 9.81214421252372e-05,
38
- "loss": 1.2092308807373047,
39
  "step": 150
40
  },
41
  {
42
  "epoch": 0.37593984962406013,
43
- "grad_norm": 0.5563158392906189,
44
- "learning_rate": 9.717267552182164e-05,
45
- "loss": 1.1433011627197265,
46
  "step": 200
47
  },
48
  {
49
  "epoch": 0.37593984962406013,
50
- "eval_loss": 1.1367270946502686,
51
- "eval_runtime": 82.9022,
52
- "eval_samples_per_second": 5.706,
53
- "eval_steps_per_second": 1.435,
54
  "step": 200
55
  },
56
  {
57
  "epoch": 0.4699248120300752,
58
- "grad_norm": 0.5556582808494568,
59
- "learning_rate": 9.622390891840608e-05,
60
- "loss": 1.1522552490234375,
61
  "step": 250
62
  },
63
  {
64
  "epoch": 0.5639097744360902,
65
- "grad_norm": 0.5758287906646729,
66
- "learning_rate": 9.527514231499052e-05,
67
- "loss": 1.0814830780029296,
68
  "step": 300
69
  },
70
  {
71
  "epoch": 0.5639097744360902,
72
- "eval_loss": 1.1028286218643188,
73
- "eval_runtime": 82.616,
74
- "eval_samples_per_second": 5.725,
75
- "eval_steps_per_second": 1.44,
76
  "step": 300
77
  },
78
  {
79
  "epoch": 0.6578947368421053,
80
- "grad_norm": 0.5769486427307129,
81
- "learning_rate": 9.432637571157496e-05,
82
- "loss": 1.124346466064453,
83
  "step": 350
84
  },
85
  {
86
  "epoch": 0.7518796992481203,
87
- "grad_norm": 0.5422045588493347,
88
- "learning_rate": 9.337760910815939e-05,
89
- "loss": 1.0794380950927733,
90
  "step": 400
91
  },
92
  {
93
  "epoch": 0.7518796992481203,
94
- "eval_loss": 1.072836995124817,
95
- "eval_runtime": 82.9563,
96
- "eval_samples_per_second": 5.702,
97
- "eval_steps_per_second": 1.434,
98
  "step": 400
99
  },
100
  {
101
  "epoch": 0.8458646616541353,
102
- "grad_norm": 0.5861876606941223,
103
- "learning_rate": 9.242884250474384e-05,
104
- "loss": 1.0750784301757812,
105
  "step": 450
106
  },
107
  {
108
  "epoch": 0.9398496240601504,
109
- "grad_norm": 0.5859329700469971,
110
- "learning_rate": 9.148007590132827e-05,
111
- "loss": 1.083390655517578,
112
  "step": 500
113
  },
114
  {
115
  "epoch": 0.9398496240601504,
116
- "eval_loss": 1.0487685203552246,
117
- "eval_runtime": 82.9841,
118
- "eval_samples_per_second": 5.7,
119
- "eval_steps_per_second": 1.434,
120
  "step": 500
121
  },
122
  {
123
  "epoch": 1.0338345864661653,
124
- "grad_norm": 0.787390410900116,
125
- "learning_rate": 9.053130929791271e-05,
126
- "loss": 1.0226116943359376,
127
  "step": 550
128
  },
129
  {
130
  "epoch": 1.1278195488721805,
131
- "grad_norm": 0.7412646412849426,
132
- "learning_rate": 8.958254269449717e-05,
133
- "loss": 0.9393210601806641,
134
  "step": 600
135
  },
136
  {
137
  "epoch": 1.1278195488721805,
138
- "eval_loss": 1.0402475595474243,
139
- "eval_runtime": 83.0546,
140
- "eval_samples_per_second": 5.695,
141
- "eval_steps_per_second": 1.433,
142
  "step": 600
143
  },
144
  {
145
  "epoch": 1.2218045112781954,
146
- "grad_norm": 0.6759052276611328,
147
- "learning_rate": 8.86337760910816e-05,
148
- "loss": 0.9417331695556641,
149
  "step": 650
150
  },
151
  {
152
  "epoch": 1.3157894736842106,
153
- "grad_norm": 0.7094544172286987,
154
- "learning_rate": 8.768500948766604e-05,
155
- "loss": 0.9495692443847656,
156
  "step": 700
157
  },
158
  {
159
  "epoch": 1.3157894736842106,
160
- "eval_loss": 1.0223630666732788,
161
- "eval_runtime": 82.8984,
162
- "eval_samples_per_second": 5.706,
163
- "eval_steps_per_second": 1.435,
164
  "step": 700
165
  },
166
  {
167
  "epoch": 1.4097744360902256,
168
- "grad_norm": 0.7613663077354431,
169
- "learning_rate": 8.673624288425048e-05,
170
- "loss": 0.9635891723632812,
171
  "step": 750
172
  },
173
  {
174
  "epoch": 1.5037593984962405,
175
- "grad_norm": 0.6828358173370361,
176
- "learning_rate": 8.578747628083492e-05,
177
- "loss": 0.9501354217529296,
178
  "step": 800
179
  },
180
  {
181
  "epoch": 1.5037593984962405,
182
- "eval_loss": 1.0105401277542114,
183
- "eval_runtime": 82.7473,
184
- "eval_samples_per_second": 5.716,
185
- "eval_steps_per_second": 1.438,
186
  "step": 800
187
  },
188
  {
189
  "epoch": 1.5977443609022557,
190
- "grad_norm": 0.7703934907913208,
191
- "learning_rate": 8.483870967741936e-05,
192
- "loss": 0.9451417541503906,
193
  "step": 850
194
  },
195
  {
196
  "epoch": 1.6917293233082706,
197
- "grad_norm": 0.8639416098594666,
198
- "learning_rate": 8.38899430740038e-05,
199
- "loss": 0.9263732147216797,
200
  "step": 900
201
  },
202
  {
203
  "epoch": 1.6917293233082706,
204
- "eval_loss": 0.9950240254402161,
205
- "eval_runtime": 82.6629,
206
- "eval_samples_per_second": 5.722,
207
- "eval_steps_per_second": 1.44,
208
  "step": 900
209
  },
210
  {
211
  "epoch": 1.7857142857142856,
212
- "grad_norm": 0.7719340324401855,
213
- "learning_rate": 8.294117647058824e-05,
214
- "loss": 0.9348648834228516,
215
  "step": 950
216
  },
217
  {
218
  "epoch": 1.8796992481203008,
219
- "grad_norm": 0.6620801687240601,
220
- "learning_rate": 8.199240986717268e-05,
221
- "loss": 0.9322538757324219,
222
  "step": 1000
223
  },
224
  {
225
  "epoch": 1.8796992481203008,
226
- "eval_loss": 0.9810675382614136,
227
- "eval_runtime": 82.874,
228
- "eval_samples_per_second": 5.707,
229
- "eval_steps_per_second": 1.436,
230
  "step": 1000
231
  },
232
  {
233
  "epoch": 1.973684210526316,
234
- "grad_norm": 0.904947817325592,
235
- "learning_rate": 8.104364326375712e-05,
236
- "loss": 0.929292221069336,
237
  "step": 1050
238
  },
239
  {
240
  "epoch": 2.0676691729323307,
241
- "grad_norm": 0.7428781390190125,
242
- "learning_rate": 8.009487666034155e-05,
243
- "loss": 0.8347126770019532,
244
  "step": 1100
245
  },
246
  {
247
  "epoch": 2.0676691729323307,
248
- "eval_loss": 0.9958235621452332,
249
- "eval_runtime": 82.8108,
250
- "eval_samples_per_second": 5.712,
251
- "eval_steps_per_second": 1.437,
252
  "step": 1100
253
  },
254
  {
255
  "epoch": 2.161654135338346,
256
- "grad_norm": 0.8485831618309021,
257
- "learning_rate": 7.9146110056926e-05,
258
- "loss": 0.7888198852539062,
259
  "step": 1150
260
  },
261
  {
262
  "epoch": 2.255639097744361,
263
- "grad_norm": 0.9114283323287964,
264
- "learning_rate": 7.819734345351045e-05,
265
- "loss": 0.7951007843017578,
266
  "step": 1200
267
  },
268
  {
269
  "epoch": 2.255639097744361,
270
- "eval_loss": 0.9948464632034302,
271
- "eval_runtime": 82.8049,
272
- "eval_samples_per_second": 5.712,
273
- "eval_steps_per_second": 1.437,
274
  "step": 1200
275
  }
276
  ],
277
  "logging_steps": 50,
278
- "max_steps": 5320,
279
  "num_input_tokens_seen": 0,
280
- "num_train_epochs": 10,
281
  "save_steps": 100,
282
  "stateful_callbacks": {
283
  "TrainerControl": {
 
1
  {
2
+ "best_global_step": 400,
3
+ "best_metric": 0.9676186442375183,
4
+ "best_model_checkpoint": "./outputs/checkpoint-400",
5
  "epoch": 2.255639097744361,
6
  "eval_steps": 100,
7
  "global_step": 1200,
 
11
  "log_history": [
12
  {
13
  "epoch": 0.09398496240601503,
14
+ "grad_norm": 0.9101622104644775,
15
  "learning_rate": 9.8e-05,
16
+ "loss": 0.7848518371582032,
17
  "step": 50
18
  },
19
  {
20
  "epoch": 0.18796992481203006,
21
+ "grad_norm": 0.8308438062667847,
22
+ "learning_rate": 9.683053040103493e-05,
23
+ "loss": 0.7757094573974609,
24
  "step": 100
25
  },
26
  {
27
  "epoch": 0.18796992481203006,
28
+ "eval_loss": 0.9840108752250671,
29
+ "eval_runtime": 81.3507,
30
+ "eval_samples_per_second": 5.814,
31
+ "eval_steps_per_second": 1.463,
32
  "step": 100
33
  },
34
  {
35
  "epoch": 0.2819548872180451,
36
+ "grad_norm": 1.0474584102630615,
37
+ "learning_rate": 9.359637774902976e-05,
38
+ "loss": 0.7674188995361328,
39
  "step": 150
40
  },
41
  {
42
  "epoch": 0.37593984962406013,
43
+ "grad_norm": 0.8780233860015869,
44
+ "learning_rate": 9.036222509702458e-05,
45
+ "loss": 0.7395731353759766,
46
  "step": 200
47
  },
48
  {
49
  "epoch": 0.37593984962406013,
50
+ "eval_loss": 0.9940316081047058,
51
+ "eval_runtime": 80.2928,
52
+ "eval_samples_per_second": 5.891,
53
+ "eval_steps_per_second": 1.482,
54
  "step": 200
55
  },
56
  {
57
  "epoch": 0.4699248120300752,
58
+ "grad_norm": 0.9176077246665955,
59
+ "learning_rate": 8.712807244501941e-05,
60
+ "loss": 0.7627955627441406,
61
  "step": 250
62
  },
63
  {
64
  "epoch": 0.5639097744360902,
65
+ "grad_norm": 0.8625491857528687,
66
+ "learning_rate": 8.389391979301423e-05,
67
+ "loss": 0.7164928436279296,
68
  "step": 300
69
  },
70
  {
71
  "epoch": 0.5639097744360902,
72
+ "eval_loss": 0.9823606014251709,
73
+ "eval_runtime": 80.8571,
74
+ "eval_samples_per_second": 5.85,
75
+ "eval_steps_per_second": 1.472,
76
  "step": 300
77
  },
78
  {
79
  "epoch": 0.6578947368421053,
80
+ "grad_norm": 0.8384292125701904,
81
+ "learning_rate": 8.065976714100906e-05,
82
+ "loss": 0.73987548828125,
83
  "step": 350
84
  },
85
  {
86
  "epoch": 0.7518796992481203,
87
+ "grad_norm": 0.8384448885917664,
88
+ "learning_rate": 7.742561448900388e-05,
89
+ "loss": 0.7277918243408203,
90
  "step": 400
91
  },
92
  {
93
  "epoch": 0.7518796992481203,
94
+ "eval_loss": 0.9676186442375183,
95
+ "eval_runtime": 80.4443,
96
+ "eval_samples_per_second": 5.88,
97
+ "eval_steps_per_second": 1.479,
98
  "step": 400
99
  },
100
  {
101
  "epoch": 0.8458646616541353,
102
+ "grad_norm": 0.866162121295929,
103
+ "learning_rate": 7.41914618369987e-05,
104
+ "loss": 0.7323916625976562,
105
  "step": 450
106
  },
107
  {
108
  "epoch": 0.9398496240601504,
109
+ "grad_norm": 0.8226180076599121,
110
+ "learning_rate": 7.095730918499353e-05,
111
+ "loss": 0.7260687255859375,
112
  "step": 500
113
  },
114
  {
115
  "epoch": 0.9398496240601504,
116
+ "eval_loss": 0.9678767919540405,
117
+ "eval_runtime": 80.5208,
118
+ "eval_samples_per_second": 5.874,
119
+ "eval_steps_per_second": 1.478,
120
  "step": 500
121
  },
122
  {
123
  "epoch": 1.0338345864661653,
124
+ "grad_norm": 1.0985685586929321,
125
+ "learning_rate": 6.772315653298837e-05,
126
+ "loss": 0.6786854553222657,
127
  "step": 550
128
  },
129
  {
130
  "epoch": 1.1278195488721805,
131
+ "grad_norm": 1.0968552827835083,
132
+ "learning_rate": 6.44890038809832e-05,
133
+ "loss": 0.580701789855957,
134
  "step": 600
135
  },
136
  {
137
  "epoch": 1.1278195488721805,
138
+ "eval_loss": 1.0256125926971436,
139
+ "eval_runtime": 80.6908,
140
+ "eval_samples_per_second": 5.862,
141
+ "eval_steps_per_second": 1.475,
142
  "step": 600
143
  },
144
  {
145
  "epoch": 1.2218045112781954,
146
+ "grad_norm": 1.0653274059295654,
147
+ "learning_rate": 6.1254851228978e-05,
148
+ "loss": 0.583438491821289,
149
  "step": 650
150
  },
151
  {
152
  "epoch": 1.3157894736842106,
153
+ "grad_norm": 1.1410211324691772,
154
+ "learning_rate": 5.802069857697283e-05,
155
+ "loss": 0.5911675262451171,
156
  "step": 700
157
  },
158
  {
159
  "epoch": 1.3157894736842106,
160
+ "eval_loss": 1.0415176153182983,
161
+ "eval_runtime": 80.2742,
162
+ "eval_samples_per_second": 5.892,
163
+ "eval_steps_per_second": 1.482,
164
  "step": 700
165
  },
166
  {
167
  "epoch": 1.4097744360902256,
168
+ "grad_norm": 1.0943447351455688,
169
+ "learning_rate": 5.478654592496766e-05,
170
+ "loss": 0.6138821029663086,
171
  "step": 750
172
  },
173
  {
174
  "epoch": 1.5037593984962405,
175
+ "grad_norm": 1.004882574081421,
176
+ "learning_rate": 5.1552393272962485e-05,
177
+ "loss": 0.6031227111816406,
178
  "step": 800
179
  },
180
  {
181
  "epoch": 1.5037593984962405,
182
+ "eval_loss": 1.0161856412887573,
183
+ "eval_runtime": 80.0684,
184
+ "eval_samples_per_second": 5.907,
185
+ "eval_steps_per_second": 1.486,
186
  "step": 800
187
  },
188
  {
189
  "epoch": 1.5977443609022557,
190
+ "grad_norm": 1.0877087116241455,
191
+ "learning_rate": 4.831824062095731e-05,
192
+ "loss": 0.5991556930541992,
193
  "step": 850
194
  },
195
  {
196
  "epoch": 1.6917293233082706,
197
+ "grad_norm": 1.2106397151947021,
198
+ "learning_rate": 4.508408796895214e-05,
199
+ "loss": 0.6013988876342773,
200
  "step": 900
201
  },
202
  {
203
  "epoch": 1.6917293233082706,
204
+ "eval_loss": 1.0028849840164185,
205
+ "eval_runtime": 80.8781,
206
+ "eval_samples_per_second": 5.848,
207
+ "eval_steps_per_second": 1.471,
208
  "step": 900
209
  },
210
  {
211
  "epoch": 1.7857142857142856,
212
+ "grad_norm": 1.123062252998352,
213
+ "learning_rate": 4.1849935316946965e-05,
214
+ "loss": 0.592793083190918,
215
  "step": 950
216
  },
217
  {
218
  "epoch": 1.8796992481203008,
219
+ "grad_norm": 1.0219600200653076,
220
+ "learning_rate": 3.861578266494178e-05,
221
+ "loss": 0.6088079071044922,
222
  "step": 1000
223
  },
224
  {
225
  "epoch": 1.8796992481203008,
226
+ "eval_loss": 1.0209505558013916,
227
+ "eval_runtime": 80.909,
228
+ "eval_samples_per_second": 5.846,
229
+ "eval_steps_per_second": 1.471,
230
  "step": 1000
231
  },
232
  {
233
  "epoch": 1.973684210526316,
234
+ "grad_norm": 1.03061044216156,
235
+ "learning_rate": 3.5381630012936615e-05,
236
+ "loss": 0.5962826919555664,
237
  "step": 1050
238
  },
239
  {
240
  "epoch": 2.0676691729323307,
241
+ "grad_norm": 1.2498968839645386,
242
+ "learning_rate": 3.214747736093144e-05,
243
+ "loss": 0.47724185943603514,
244
  "step": 1100
245
  },
246
  {
247
  "epoch": 2.0676691729323307,
248
+ "eval_loss": 1.1276904344558716,
249
+ "eval_runtime": 81.046,
250
+ "eval_samples_per_second": 5.836,
251
+ "eval_steps_per_second": 1.468,
252
  "step": 1100
253
  },
254
  {
255
  "epoch": 2.161654135338346,
256
+ "grad_norm": 1.1484302282333374,
257
+ "learning_rate": 2.8913324708926264e-05,
258
+ "loss": 0.4027834701538086,
259
  "step": 1150
260
  },
261
  {
262
  "epoch": 2.255639097744361,
263
+ "grad_norm": 1.2905447483062744,
264
+ "learning_rate": 2.5679172056921085e-05,
265
+ "loss": 0.4188160705566406,
266
  "step": 1200
267
  },
268
  {
269
  "epoch": 2.255639097744361,
270
+ "eval_loss": 1.1084345579147339,
271
+ "eval_runtime": 80.5472,
272
+ "eval_samples_per_second": 5.872,
273
+ "eval_steps_per_second": 1.477,
274
  "step": 1200
275
  }
276
  ],
277
  "logging_steps": 50,
278
+ "max_steps": 1596,
279
  "num_input_tokens_seen": 0,
280
+ "num_train_epochs": 3,
281
  "save_steps": 100,
282
  "stateful_callbacks": {
283
  "TrainerControl": {
checkpoint-step-1200/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bc05806d2c86681ef6c541c75942126f28b3a31aec0d903899ed9bf1ea303bac
3
  size 5713
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3c88f5ec73ab38f2f0a5bb321f3c58aaa6f716ae0e803b69ff493f9e0c43f221
3
  size 5713