SeTo97 commited on
Commit
e932916
·
verified ·
1 Parent(s): 23eae43

Best F1=0.7795 (trial 10)

Browse files

Hyper‑parameters: {'learning_rate': 4.437063943360846e-06, 'weight_decay': 0.0017391423354692903, 'batch_size': 32, 'warmup_ratio': 0.09464137213269672, 'hidden_dropout': 0.053138253462458006, 'attn_dropout': 0.2735895207101088, 'classifier_dropout': 0.39340169178729456, 'epoch': 10.447761194029852}

config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "RobertaForSequenceClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.2735895207101088,
6
+ "bos_token_id": 0,
7
+ "classifier_dropout": 0.39340169178729456,
8
+ "eos_token_id": 2,
9
+ "gradient_checkpointing": false,
10
+ "hidden_act": "gelu",
11
+ "hidden_dropout_prob": 0.053138253462458006,
12
+ "hidden_size": 768,
13
+ "id2label": {
14
+ "0": "M",
15
+ "1": "NM"
16
+ },
17
+ "initializer_range": 0.02,
18
+ "intermediate_size": 3072,
19
+ "label2id": {
20
+ "M": 0,
21
+ "NM": 1
22
+ },
23
+ "layer_norm_eps": 1e-05,
24
+ "max_position_embeddings": 514,
25
+ "model_type": "roberta",
26
+ "num_attention_heads": 12,
27
+ "num_hidden_layers": 12,
28
+ "pad_token_id": 1,
29
+ "position_embedding_type": "absolute",
30
+ "torch_dtype": "float32",
31
+ "transformers_version": "4.51.3",
32
+ "type_vocab_size": 1,
33
+ "use_cache": true,
34
+ "vocab_size": 50262
35
+ }
merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:238d8f17bfba9751b89dd4276821eff7d5046748d169b1e8df6722e19e88f51e
3
+ size 498603608
optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:35a6e50574846c23126f8c5408f5a1047e59071de247c7c43c5f610c8750e64b
3
+ size 997327098
rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8dcb5238779ec6957f466f5f3ad7dd55e13d492f8d41fbd8eb9e576c04c93a1e
3
+ size 14244
scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:042e25180ae7eb4b4b781d7cbe3a4bed50b71b320d1307baca737eadff985a68
3
+ size 988
scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:53d20ac6487a3cfdeeb7da204127eda74e631c6c06e14703d5e999cedbeedc93
3
+ size 1064
special_tokens_map.json ADDED
@@ -0,0 +1,51 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token": {
3
+ "content": "<s>",
4
+ "lstrip": false,
5
+ "normalized": true,
6
+ "rstrip": false,
7
+ "single_word": false
8
+ },
9
+ "cls_token": {
10
+ "content": "<s>",
11
+ "lstrip": false,
12
+ "normalized": true,
13
+ "rstrip": false,
14
+ "single_word": false
15
+ },
16
+ "eos_token": {
17
+ "content": "</s>",
18
+ "lstrip": false,
19
+ "normalized": true,
20
+ "rstrip": false,
21
+ "single_word": false
22
+ },
23
+ "mask_token": {
24
+ "content": "<mask>",
25
+ "lstrip": true,
26
+ "normalized": true,
27
+ "rstrip": false,
28
+ "single_word": false
29
+ },
30
+ "pad_token": {
31
+ "content": "<pad>",
32
+ "lstrip": false,
33
+ "normalized": true,
34
+ "rstrip": false,
35
+ "single_word": false
36
+ },
37
+ "sep_token": {
38
+ "content": "</s>",
39
+ "lstrip": false,
40
+ "normalized": true,
41
+ "rstrip": false,
42
+ "single_word": false
43
+ },
44
+ "unk_token": {
45
+ "content": "<unk>",
46
+ "lstrip": false,
47
+ "normalized": true,
48
+ "rstrip": false,
49
+ "single_word": false
50
+ }
51
+ }
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,59 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "added_tokens_decoder": {
4
+ "0": {
5
+ "content": "<s>",
6
+ "lstrip": false,
7
+ "normalized": true,
8
+ "rstrip": false,
9
+ "single_word": false,
10
+ "special": true
11
+ },
12
+ "1": {
13
+ "content": "<pad>",
14
+ "lstrip": false,
15
+ "normalized": true,
16
+ "rstrip": false,
17
+ "single_word": false,
18
+ "special": true
19
+ },
20
+ "2": {
21
+ "content": "</s>",
22
+ "lstrip": false,
23
+ "normalized": true,
24
+ "rstrip": false,
25
+ "single_word": false,
26
+ "special": true
27
+ },
28
+ "3": {
29
+ "content": "<unk>",
30
+ "lstrip": false,
31
+ "normalized": true,
32
+ "rstrip": false,
33
+ "single_word": false,
34
+ "special": true
35
+ },
36
+ "4": {
37
+ "content": "<mask>",
38
+ "lstrip": true,
39
+ "normalized": true,
40
+ "rstrip": false,
41
+ "single_word": false,
42
+ "special": true
43
+ }
44
+ },
45
+ "bos_token": "<s>",
46
+ "clean_up_tokenization_spaces": false,
47
+ "cls_token": "<s>",
48
+ "eos_token": "</s>",
49
+ "errors": "replace",
50
+ "extra_special_tokens": {},
51
+ "mask_token": "<mask>",
52
+ "max_len": 512,
53
+ "model_max_length": 512,
54
+ "pad_token": "<pad>",
55
+ "sep_token": "</s>",
56
+ "tokenizer_class": "RobertaTokenizer",
57
+ "trim_offsets": true,
58
+ "unk_token": "<unk>"
59
+ }
trainer_state.json ADDED
@@ -0,0 +1,309 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 1400,
3
+ "best_metric": 0.7795431976166831,
4
+ "best_model_checkpoint": "./hpo_PlanTL-GOB-ES_roberta-base-bne/trial_10/checkpoint-1400",
5
+ "epoch": 10.447761194029852,
6
+ "eval_steps": 100,
7
+ "global_step": 1400,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.746268656716418,
14
+ "grad_norm": 1.1734787225723267,
15
+ "learning_rate": 2.299839426139915e-06,
16
+ "loss": 0.6959,
17
+ "step": 100
18
+ },
19
+ {
20
+ "epoch": 0.746268656716418,
21
+ "eval_accuracy": 0.6081081081081081,
22
+ "eval_f1": 0.442484773258667,
23
+ "eval_loss": 0.6894811391830444,
24
+ "eval_precision": 0.4994814622763806,
25
+ "eval_recall": 0.4998257839721254,
26
+ "eval_runtime": 0.3253,
27
+ "eval_samples_per_second": 682.392,
28
+ "eval_steps_per_second": 21.517,
29
+ "step": 100
30
+ },
31
+ {
32
+ "epoch": 1.4925373134328357,
33
+ "grad_norm": 2.857347011566162,
34
+ "learning_rate": 4.41754964344502e-06,
35
+ "loss": 0.6866,
36
+ "step": 200
37
+ },
38
+ {
39
+ "epoch": 1.4925373134328357,
40
+ "eval_accuracy": 0.6936936936936937,
41
+ "eval_f1": 0.6659290077011596,
42
+ "eval_loss": 0.6791544556617737,
43
+ "eval_precision": 0.6693403028118241,
44
+ "eval_recall": 0.6636759581881533,
45
+ "eval_runtime": 0.3219,
46
+ "eval_samples_per_second": 689.684,
47
+ "eval_steps_per_second": 21.747,
48
+ "step": 200
49
+ },
50
+ {
51
+ "epoch": 2.2388059701492535,
52
+ "grad_norm": 5.069456100463867,
53
+ "learning_rate": 4.176060181986678e-06,
54
+ "loss": 0.6555,
55
+ "step": 300
56
+ },
57
+ {
58
+ "epoch": 2.2388059701492535,
59
+ "eval_accuracy": 0.6981981981981982,
60
+ "eval_f1": 0.5875093596605563,
61
+ "eval_loss": 0.5988879799842834,
62
+ "eval_precision": 0.7426395939086294,
63
+ "eval_recall": 0.6040940766550522,
64
+ "eval_runtime": 0.3255,
65
+ "eval_samples_per_second": 681.953,
66
+ "eval_steps_per_second": 21.503,
67
+ "step": 300
68
+ },
69
+ {
70
+ "epoch": 2.9850746268656714,
71
+ "grad_norm": 5.771562099456787,
72
+ "learning_rate": 3.9321314330388585e-06,
73
+ "loss": 0.5745,
74
+ "step": 400
75
+ },
76
+ {
77
+ "epoch": 2.9850746268656714,
78
+ "eval_accuracy": 0.7252252252252253,
79
+ "eval_f1": 0.637943480469481,
80
+ "eval_loss": 0.5637385249137878,
81
+ "eval_precision": 0.772757980070934,
82
+ "eval_recall": 0.6406794425087108,
83
+ "eval_runtime": 0.3245,
84
+ "eval_samples_per_second": 684.169,
85
+ "eval_steps_per_second": 21.573,
86
+ "step": 400
87
+ },
88
+ {
89
+ "epoch": 3.7313432835820897,
90
+ "grad_norm": 6.657003879547119,
91
+ "learning_rate": 3.6882026840910388e-06,
92
+ "loss": 0.5315,
93
+ "step": 500
94
+ },
95
+ {
96
+ "epoch": 3.7313432835820897,
97
+ "eval_accuracy": 0.7612612612612613,
98
+ "eval_f1": 0.724597991714065,
99
+ "eval_loss": 0.5057556629180908,
100
+ "eval_precision": 0.7563169387542893,
101
+ "eval_recall": 0.7147212543554007,
102
+ "eval_runtime": 0.3235,
103
+ "eval_samples_per_second": 686.192,
104
+ "eval_steps_per_second": 21.637,
105
+ "step": 500
106
+ },
107
+ {
108
+ "epoch": 4.477611940298507,
109
+ "grad_norm": 6.151370048522949,
110
+ "learning_rate": 3.4442739351432187e-06,
111
+ "loss": 0.4973,
112
+ "step": 600
113
+ },
114
+ {
115
+ "epoch": 4.477611940298507,
116
+ "eval_accuracy": 0.7747747747747747,
117
+ "eval_f1": 0.7448745058380069,
118
+ "eval_loss": 0.4851745069026947,
119
+ "eval_precision": 0.7674050632911392,
120
+ "eval_recall": 0.7355400696864112,
121
+ "eval_runtime": 0.3262,
122
+ "eval_samples_per_second": 680.614,
123
+ "eval_steps_per_second": 21.461,
124
+ "step": 600
125
+ },
126
+ {
127
+ "epoch": 5.223880597014926,
128
+ "grad_norm": 10.251242637634277,
129
+ "learning_rate": 3.2003451861953985e-06,
130
+ "loss": 0.4523,
131
+ "step": 700
132
+ },
133
+ {
134
+ "epoch": 5.223880597014926,
135
+ "eval_accuracy": 0.7567567567567568,
136
+ "eval_f1": 0.7204551814196436,
137
+ "eval_loss": 0.48035961389541626,
138
+ "eval_precision": 0.7493827160493827,
139
+ "eval_recall": 0.7111498257839721,
140
+ "eval_runtime": 0.3234,
141
+ "eval_samples_per_second": 686.473,
142
+ "eval_steps_per_second": 21.646,
143
+ "step": 700
144
+ },
145
+ {
146
+ "epoch": 5.970149253731344,
147
+ "grad_norm": 5.884487628936768,
148
+ "learning_rate": 2.9564164372475784e-06,
149
+ "loss": 0.4519,
150
+ "step": 800
151
+ },
152
+ {
153
+ "epoch": 5.970149253731344,
154
+ "eval_accuracy": 0.7612612612612613,
155
+ "eval_f1": 0.7444118605408928,
156
+ "eval_loss": 0.4888066351413727,
157
+ "eval_precision": 0.7438242177342463,
158
+ "eval_recall": 0.7450348432055749,
159
+ "eval_runtime": 0.3288,
160
+ "eval_samples_per_second": 675.222,
161
+ "eval_steps_per_second": 21.291,
162
+ "step": 800
163
+ },
164
+ {
165
+ "epoch": 6.7164179104477615,
166
+ "grad_norm": 5.6701226234436035,
167
+ "learning_rate": 2.7124876882997587e-06,
168
+ "loss": 0.4267,
169
+ "step": 900
170
+ },
171
+ {
172
+ "epoch": 6.7164179104477615,
173
+ "eval_accuracy": 0.7522522522522522,
174
+ "eval_f1": 0.7183715834390497,
175
+ "eval_loss": 0.470042884349823,
176
+ "eval_precision": 0.7407906558849955,
177
+ "eval_recall": 0.7101045296167248,
178
+ "eval_runtime": 0.3283,
179
+ "eval_samples_per_second": 676.253,
180
+ "eval_steps_per_second": 21.323,
181
+ "step": 900
182
+ },
183
+ {
184
+ "epoch": 7.462686567164179,
185
+ "grad_norm": 14.518937110900879,
186
+ "learning_rate": 2.4685589393519386e-06,
187
+ "loss": 0.4149,
188
+ "step": 1000
189
+ },
190
+ {
191
+ "epoch": 7.462686567164179,
192
+ "eval_accuracy": 0.7837837837837838,
193
+ "eval_f1": 0.7628205128205128,
194
+ "eval_loss": 0.47342488169670105,
195
+ "eval_precision": 0.7702702702702703,
196
+ "eval_recall": 0.7578397212543554,
197
+ "eval_runtime": 0.3222,
198
+ "eval_samples_per_second": 688.983,
199
+ "eval_steps_per_second": 21.725,
200
+ "step": 1000
201
+ },
202
+ {
203
+ "epoch": 8.208955223880597,
204
+ "grad_norm": 6.513219356536865,
205
+ "learning_rate": 2.2246301904041184e-06,
206
+ "loss": 0.3897,
207
+ "step": 1100
208
+ },
209
+ {
210
+ "epoch": 8.208955223880597,
211
+ "eval_accuracy": 0.7702702702702703,
212
+ "eval_f1": 0.7501489572989076,
213
+ "eval_loss": 0.4738766849040985,
214
+ "eval_precision": 0.7540976265114196,
215
+ "eval_recall": 0.7471254355400697,
216
+ "eval_runtime": 0.3272,
217
+ "eval_samples_per_second": 678.418,
218
+ "eval_steps_per_second": 21.392,
219
+ "step": 1100
220
+ },
221
+ {
222
+ "epoch": 8.955223880597014,
223
+ "grad_norm": 19.53132438659668,
224
+ "learning_rate": 1.9807014414562983e-06,
225
+ "loss": 0.3806,
226
+ "step": 1200
227
+ },
228
+ {
229
+ "epoch": 8.955223880597014,
230
+ "eval_accuracy": 0.7837837837837838,
231
+ "eval_f1": 0.759913482335977,
232
+ "eval_loss": 0.46905937790870667,
233
+ "eval_precision": 0.7727443609022557,
234
+ "eval_recall": 0.7527874564459931,
235
+ "eval_runtime": 0.3253,
236
+ "eval_samples_per_second": 682.365,
237
+ "eval_steps_per_second": 21.516,
238
+ "step": 1200
239
+ },
240
+ {
241
+ "epoch": 9.701492537313433,
242
+ "grad_norm": 12.14911937713623,
243
+ "learning_rate": 1.7367726925084784e-06,
244
+ "loss": 0.3609,
245
+ "step": 1300
246
+ },
247
+ {
248
+ "epoch": 9.701492537313433,
249
+ "eval_accuracy": 0.7837837837837838,
250
+ "eval_f1": 0.7679442508710801,
251
+ "eval_loss": 0.48617300391197205,
252
+ "eval_precision": 0.7679442508710801,
253
+ "eval_recall": 0.7679442508710801,
254
+ "eval_runtime": 0.3248,
255
+ "eval_samples_per_second": 683.448,
256
+ "eval_steps_per_second": 21.55,
257
+ "step": 1300
258
+ },
259
+ {
260
+ "epoch": 10.447761194029852,
261
+ "grad_norm": 15.257988929748535,
262
+ "learning_rate": 1.4928439435606583e-06,
263
+ "loss": 0.3456,
264
+ "step": 1400
265
+ },
266
+ {
267
+ "epoch": 10.447761194029852,
268
+ "eval_accuracy": 0.7972972972972973,
269
+ "eval_f1": 0.7795431976166831,
270
+ "eval_loss": 0.4786612093448639,
271
+ "eval_precision": 0.783922973578146,
272
+ "eval_recall": 0.7761324041811846,
273
+ "eval_runtime": 0.3278,
274
+ "eval_samples_per_second": 677.161,
275
+ "eval_steps_per_second": 21.352,
276
+ "step": 1400
277
+ }
278
+ ],
279
+ "logging_steps": 100,
280
+ "max_steps": 2010,
281
+ "num_input_tokens_seen": 0,
282
+ "num_train_epochs": 15,
283
+ "save_steps": 100,
284
+ "stateful_callbacks": {
285
+ "EarlyStoppingCallback": {
286
+ "args": {
287
+ "early_stopping_patience": 4,
288
+ "early_stopping_threshold": 0.0
289
+ },
290
+ "attributes": {
291
+ "early_stopping_patience_counter": 0
292
+ }
293
+ },
294
+ "TrainerControl": {
295
+ "args": {
296
+ "should_epoch_stop": false,
297
+ "should_evaluate": false,
298
+ "should_log": false,
299
+ "should_save": true,
300
+ "should_training_stop": false
301
+ },
302
+ "attributes": {}
303
+ }
304
+ },
305
+ "total_flos": 1.17373841796096e+16,
306
+ "train_batch_size": 32,
307
+ "trial_name": null,
308
+ "trial_params": null
309
+ }
training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:99f3a3c337e0c63af9fc8d9493048fda0d36e478d1b317c852330539661cee96
3
+ size 5304
vocab.json ADDED
The diff for this file is too large to render. See raw diff