NourFakih commited on
Commit
7ef592c
·
verified ·
1 Parent(s): b1d02e5

Upload checkpoint and eval results at step 3500

Browse files
checkpoint-3500/config.json ADDED
@@ -0,0 +1,38 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_cross_attention": false,
3
+ "architectures": [
4
+ "BertForSequenceClassification"
5
+ ],
6
+ "attention_probs_dropout_prob": 0.1,
7
+ "bos_token_id": null,
8
+ "classifier_dropout": null,
9
+ "dtype": "float32",
10
+ "eos_token_id": null,
11
+ "gradient_checkpointing": false,
12
+ "hidden_act": "gelu",
13
+ "hidden_dropout_prob": 0.1,
14
+ "hidden_size": 768,
15
+ "id2label": {
16
+ "0": "benign",
17
+ "1": "malicious"
18
+ },
19
+ "initializer_range": 0.02,
20
+ "intermediate_size": 3072,
21
+ "is_decoder": false,
22
+ "label2id": {
23
+ "benign": 0,
24
+ "malicious": 1
25
+ },
26
+ "layer_norm_eps": 1e-12,
27
+ "max_position_embeddings": 512,
28
+ "model_type": "bert",
29
+ "num_attention_heads": 12,
30
+ "num_hidden_layers": 12,
31
+ "pad_token_id": 0,
32
+ "position_embedding_type": "absolute",
33
+ "tie_word_embeddings": true,
34
+ "transformers_version": "5.12.1",
35
+ "type_vocab_size": 2,
36
+ "use_cache": false,
37
+ "vocab_size": 30522
38
+ }
checkpoint-3500/eval_results.json ADDED
@@ -0,0 +1,12 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "step": 3500,
3
+ "epoch": 2.831715210355987,
4
+ "time": "2026-06-26 22:48:00",
5
+ "metrics": {
6
+ "eval_loss": 0.1581990271806717,
7
+ "eval_accuracy": 0.9676604345629105,
8
+ "eval_precision": 0.9718954248366013,
9
+ "eval_recall": 0.9860742705570292,
10
+ "eval_f1": 0.9789335088874259
11
+ }
12
+ }
checkpoint-3500/eval_step_003500.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "step": 3500,
3
+ "epoch": 2.831715210355987,
4
+ "time": "2026-06-26 22:48:00",
5
+ "metrics": {
6
+ "eval_loss": 0.1581990271806717,
7
+ "eval_accuracy": 0.9676604345629105,
8
+ "eval_precision": 0.9718954248366013,
9
+ "eval_recall": 0.9860742705570292,
10
+ "eval_f1": 0.9789335088874259,
11
+ "eval_runtime": 34.2504,
12
+ "eval_samples_per_second": 57.78,
13
+ "eval_steps_per_second": 3.62,
14
+ "epoch": 2.831715210355987
15
+ }
16
+ }
checkpoint-3500/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9581fd443e218b770477db9fea4eebcaa1d51c1542792f3603d9c7b2b4ebca23
3
+ size 437958624
checkpoint-3500/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2e49643f03c1cd14315908fb8099a4a82994bfa948894f9c054fbc552fe0ca97
3
+ size 876041611
checkpoint-3500/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7a502a5a86e198b70b9e3f3adf4f43fae0d2b9e246f1f384ef9d53dbec1560d3
3
+ size 14645
checkpoint-3500/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ac1b9358ab1cb9acff90f4d1d692ac08bbdb1986a66544aed9f6fe9b801b17b3
3
+ size 1383
checkpoint-3500/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:935e7fb4649ad74c00f1fa3751f08b20d79beb9d2f313ae17514c7da448b90a6
3
+ size 1465
checkpoint-3500/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-3500/tokenizer_config.json ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "cls_token": "[CLS]",
4
+ "do_lower_case": true,
5
+ "is_local": false,
6
+ "local_files_only": false,
7
+ "mask_token": "[MASK]",
8
+ "model_max_length": 1000000000,
9
+ "pad_token": "[PAD]",
10
+ "sep_token": "[SEP]",
11
+ "strip_accents": null,
12
+ "tokenize_chinese_chars": true,
13
+ "tokenizer_class": "BertTokenizer",
14
+ "unk_token": "[UNK]"
15
+ }
checkpoint-3500/trainer_state.json ADDED
@@ -0,0 +1,1114 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 3500,
3
+ "best_metric": 0.9789335088874259,
4
+ "best_model_checkpoint": "/kaggle/working/outputs/bert_rd_keystrokes/checkpoint-3500",
5
+ "epoch": 2.831715210355987,
6
+ "eval_steps": 500,
7
+ "global_step": 3500,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0008090614886731392,
14
+ "grad_norm": 2.5394184589385986,
15
+ "learning_rate": 0.0,
16
+ "loss": 0.6913009285926819,
17
+ "step": 1
18
+ },
19
+ {
20
+ "epoch": 0.020226537216828478,
21
+ "grad_norm": 3.3882575035095215,
22
+ "learning_rate": 9.716599190283402e-07,
23
+ "loss": 0.710881233215332,
24
+ "step": 25
25
+ },
26
+ {
27
+ "epoch": 0.040453074433656956,
28
+ "grad_norm": 4.59527063369751,
29
+ "learning_rate": 1.9838056680161946e-06,
30
+ "loss": 0.6965625762939454,
31
+ "step": 50
32
+ },
33
+ {
34
+ "epoch": 0.06067961165048544,
35
+ "grad_norm": 6.466946125030518,
36
+ "learning_rate": 2.995951417004049e-06,
37
+ "loss": 0.6713954925537109,
38
+ "step": 75
39
+ },
40
+ {
41
+ "epoch": 0.08090614886731391,
42
+ "grad_norm": 5.92415714263916,
43
+ "learning_rate": 4.008097165991903e-06,
44
+ "loss": 0.6306858444213868,
45
+ "step": 100
46
+ },
47
+ {
48
+ "epoch": 0.1011326860841424,
49
+ "grad_norm": 7.790467262268066,
50
+ "learning_rate": 5.020242914979757e-06,
51
+ "loss": 0.5511775207519531,
52
+ "step": 125
53
+ },
54
+ {
55
+ "epoch": 0.12135922330097088,
56
+ "grad_norm": 5.874857425689697,
57
+ "learning_rate": 6.0323886639676124e-06,
58
+ "loss": 0.5026376342773438,
59
+ "step": 150
60
+ },
61
+ {
62
+ "epoch": 0.14158576051779936,
63
+ "grad_norm": 12.701870918273926,
64
+ "learning_rate": 7.044534412955466e-06,
65
+ "loss": 0.4295468521118164,
66
+ "step": 175
67
+ },
68
+ {
69
+ "epoch": 0.16181229773462782,
70
+ "grad_norm": 5.137658596038818,
71
+ "learning_rate": 8.056680161943322e-06,
72
+ "loss": 0.3788005828857422,
73
+ "step": 200
74
+ },
75
+ {
76
+ "epoch": 0.1820388349514563,
77
+ "grad_norm": 5.249273300170898,
78
+ "learning_rate": 9.068825910931175e-06,
79
+ "loss": 0.2651861381530762,
80
+ "step": 225
81
+ },
82
+ {
83
+ "epoch": 0.2022653721682848,
84
+ "grad_norm": 38.753013610839844,
85
+ "learning_rate": 1.008097165991903e-05,
86
+ "loss": 0.3065790557861328,
87
+ "step": 250
88
+ },
89
+ {
90
+ "epoch": 0.22249190938511326,
91
+ "grad_norm": 13.836112022399902,
92
+ "learning_rate": 1.1093117408906884e-05,
93
+ "loss": 0.38094028472900393,
94
+ "step": 275
95
+ },
96
+ {
97
+ "epoch": 0.24271844660194175,
98
+ "grad_norm": 6.559873580932617,
99
+ "learning_rate": 1.2105263157894737e-05,
100
+ "loss": 0.3118729019165039,
101
+ "step": 300
102
+ },
103
+ {
104
+ "epoch": 0.26294498381877024,
105
+ "grad_norm": 7.356478214263916,
106
+ "learning_rate": 1.3117408906882592e-05,
107
+ "loss": 0.23761932373046876,
108
+ "step": 325
109
+ },
110
+ {
111
+ "epoch": 0.28317152103559873,
112
+ "grad_norm": 4.0845184326171875,
113
+ "learning_rate": 1.4129554655870446e-05,
114
+ "loss": 0.26587358474731443,
115
+ "step": 350
116
+ },
117
+ {
118
+ "epoch": 0.30339805825242716,
119
+ "grad_norm": 28.685104370117188,
120
+ "learning_rate": 1.5141700404858302e-05,
121
+ "loss": 0.3239314651489258,
122
+ "step": 375
123
+ },
124
+ {
125
+ "epoch": 0.32362459546925565,
126
+ "grad_norm": 1.7896462678909302,
127
+ "learning_rate": 1.6153846153846154e-05,
128
+ "loss": 0.24046634674072265,
129
+ "step": 400
130
+ },
131
+ {
132
+ "epoch": 0.34385113268608414,
133
+ "grad_norm": 6.960549831390381,
134
+ "learning_rate": 1.716599190283401e-05,
135
+ "loss": 0.27144105911254884,
136
+ "step": 425
137
+ },
138
+ {
139
+ "epoch": 0.3640776699029126,
140
+ "grad_norm": 22.062820434570312,
141
+ "learning_rate": 1.8178137651821864e-05,
142
+ "loss": 0.24825719833374024,
143
+ "step": 450
144
+ },
145
+ {
146
+ "epoch": 0.3843042071197411,
147
+ "grad_norm": 0.4285735785961151,
148
+ "learning_rate": 1.9190283400809718e-05,
149
+ "loss": 0.22249792098999024,
150
+ "step": 475
151
+ },
152
+ {
153
+ "epoch": 0.4045307443365696,
154
+ "grad_norm": 0.26966607570648193,
155
+ "learning_rate": 1.999993769982229e-05,
156
+ "loss": 0.25503772735595703,
157
+ "step": 500
158
+ },
159
+ {
160
+ "epoch": 0.4045307443365696,
161
+ "eval_accuracy": 0.9550277918140475,
162
+ "eval_f1": 0.9709055246812683,
163
+ "eval_loss": 0.1790667176246643,
164
+ "eval_precision": 0.9574468085106383,
165
+ "eval_recall": 0.9847480106100795,
166
+ "eval_runtime": 34.5481,
167
+ "eval_samples_per_second": 57.282,
168
+ "eval_steps_per_second": 3.589,
169
+ "step": 500
170
+ },
171
+ {
172
+ "epoch": 0.42475728155339804,
173
+ "grad_norm": 1.232269048690796,
174
+ "learning_rate": 1.9997757275108847e-05,
175
+ "loss": 0.2667963790893555,
176
+ "step": 525
177
+ },
178
+ {
179
+ "epoch": 0.4449838187702265,
180
+ "grad_norm": 12.561880111694336,
181
+ "learning_rate": 1.9992462617728763e-05,
182
+ "loss": 0.2216647148132324,
183
+ "step": 550
184
+ },
185
+ {
186
+ "epoch": 0.465210355987055,
187
+ "grad_norm": 0.4093881845474243,
188
+ "learning_rate": 1.9984055376931414e-05,
189
+ "loss": 0.23123834609985353,
190
+ "step": 575
191
+ },
192
+ {
193
+ "epoch": 0.4854368932038835,
194
+ "grad_norm": 3.573305368423462,
195
+ "learning_rate": 1.9972538171514525e-05,
196
+ "loss": 0.2226162338256836,
197
+ "step": 600
198
+ },
199
+ {
200
+ "epoch": 0.5056634304207119,
201
+ "grad_norm": 12.511730194091797,
202
+ "learning_rate": 1.9957914589008405e-05,
203
+ "loss": 0.2451229476928711,
204
+ "step": 625
205
+ },
206
+ {
207
+ "epoch": 0.5258899676375405,
208
+ "grad_norm": 11.676703453063965,
209
+ "learning_rate": 1.9940189184558487e-05,
210
+ "loss": 0.25127721786499024,
211
+ "step": 650
212
+ },
213
+ {
214
+ "epoch": 0.5461165048543689,
215
+ "grad_norm": 5.444802284240723,
216
+ "learning_rate": 1.9919367479506413e-05,
217
+ "loss": 0.30009620666503906,
218
+ "step": 675
219
+ },
220
+ {
221
+ "epoch": 0.5663430420711975,
222
+ "grad_norm": 1.9753400087356567,
223
+ "learning_rate": 1.989545595967018e-05,
224
+ "loss": 0.3415143585205078,
225
+ "step": 700
226
+ },
227
+ {
228
+ "epoch": 0.5865695792880259,
229
+ "grad_norm": 0.7816814184188843,
230
+ "learning_rate": 1.986846207332384e-05,
231
+ "loss": 0.24259204864501954,
232
+ "step": 725
233
+ },
234
+ {
235
+ "epoch": 0.6067961165048543,
236
+ "grad_norm": 20.42180061340332,
237
+ "learning_rate": 1.9838394228877443e-05,
238
+ "loss": 0.1343485450744629,
239
+ "step": 750
240
+ },
241
+ {
242
+ "epoch": 0.6270226537216829,
243
+ "grad_norm": 21.677453994750977,
244
+ "learning_rate": 1.980526179225785e-05,
245
+ "loss": 0.25507625579833987,
246
+ "step": 775
247
+ },
248
+ {
249
+ "epoch": 0.6472491909385113,
250
+ "grad_norm": 4.561895370483398,
251
+ "learning_rate": 1.97690750839913e-05,
252
+ "loss": 0.26329845428466797,
253
+ "step": 800
254
+ },
255
+ {
256
+ "epoch": 0.6674757281553398,
257
+ "grad_norm": 0.17717082798480988,
258
+ "learning_rate": 1.9729845375988694e-05,
259
+ "loss": 0.16668357849121093,
260
+ "step": 825
261
+ },
262
+ {
263
+ "epoch": 0.6877022653721683,
264
+ "grad_norm": 6.059898853302002,
265
+ "learning_rate": 1.968758488803439e-05,
266
+ "loss": 0.2621467399597168,
267
+ "step": 850
268
+ },
269
+ {
270
+ "epoch": 0.7079288025889967,
271
+ "grad_norm": 5.8439130783081055,
272
+ "learning_rate": 1.9642306783979902e-05,
273
+ "loss": 0.3152758979797363,
274
+ "step": 875
275
+ },
276
+ {
277
+ "epoch": 0.7281553398058253,
278
+ "grad_norm": 5.4012041091918945,
279
+ "learning_rate": 1.959402516764339e-05,
280
+ "loss": 0.2474656867980957,
281
+ "step": 900
282
+ },
283
+ {
284
+ "epoch": 0.7483818770226537,
285
+ "grad_norm": 13.964224815368652,
286
+ "learning_rate": 1.954275507841646e-05,
287
+ "loss": 0.22230056762695313,
288
+ "step": 925
289
+ },
290
+ {
291
+ "epoch": 0.7686084142394822,
292
+ "grad_norm": 8.115334510803223,
293
+ "learning_rate": 1.948851248657947e-05,
294
+ "loss": 0.3234273910522461,
295
+ "step": 950
296
+ },
297
+ {
298
+ "epoch": 0.7888349514563107,
299
+ "grad_norm": 0.23621903359889984,
300
+ "learning_rate": 1.9431314288326925e-05,
301
+ "loss": 0.1469671630859375,
302
+ "step": 975
303
+ },
304
+ {
305
+ "epoch": 0.8090614886731392,
306
+ "grad_norm": 3.0084638595581055,
307
+ "learning_rate": 1.9371178300504394e-05,
308
+ "loss": 0.24907604217529297,
309
+ "step": 1000
310
+ },
311
+ {
312
+ "epoch": 0.8090614886731392,
313
+ "eval_accuracy": 0.9615967660434563,
314
+ "eval_f1": 0.9752604166666666,
315
+ "eval_loss": 0.15361516177654266,
316
+ "eval_precision": 0.9578005115089514,
317
+ "eval_recall": 0.993368700265252,
318
+ "eval_runtime": 34.2684,
319
+ "eval_samples_per_second": 57.75,
320
+ "eval_steps_per_second": 3.618,
321
+ "step": 1000
322
+ },
323
+ {
324
+ "epoch": 0.8292880258899676,
325
+ "grad_norm": 0.658998429775238,
326
+ "learning_rate": 1.930812325505871e-05,
327
+ "loss": 0.128564510345459,
328
+ "step": 1025
329
+ },
330
+ {
331
+ "epoch": 0.8495145631067961,
332
+ "grad_norm": 14.597765922546387,
333
+ "learning_rate": 1.9242168793203088e-05,
334
+ "loss": 0.28263355255126954,
335
+ "step": 1050
336
+ },
337
+ {
338
+ "epoch": 0.8697411003236246,
339
+ "grad_norm": 10.520459175109863,
340
+ "learning_rate": 1.9173335459299025e-05,
341
+ "loss": 0.20550737380981446,
342
+ "step": 1075
343
+ },
344
+ {
345
+ "epoch": 0.889967637540453,
346
+ "grad_norm": 8.196412086486816,
347
+ "learning_rate": 1.9101644694456873e-05,
348
+ "loss": 0.21728286743164063,
349
+ "step": 1100
350
+ },
351
+ {
352
+ "epoch": 0.9101941747572816,
353
+ "grad_norm": 10.451470375061035,
354
+ "learning_rate": 1.902711882985708e-05,
355
+ "loss": 0.22805599212646485,
356
+ "step": 1125
357
+ },
358
+ {
359
+ "epoch": 0.93042071197411,
360
+ "grad_norm": 0.7729430794715881,
361
+ "learning_rate": 1.894978107979417e-05,
362
+ "loss": 0.19682933807373046,
363
+ "step": 1150
364
+ },
365
+ {
366
+ "epoch": 0.9506472491909385,
367
+ "grad_norm": 1.208465814590454,
368
+ "learning_rate": 1.886965553444568e-05,
369
+ "loss": 0.21496267318725587,
370
+ "step": 1175
371
+ },
372
+ {
373
+ "epoch": 0.970873786407767,
374
+ "grad_norm": 8.930377006530762,
375
+ "learning_rate": 1.8786767152368197e-05,
376
+ "loss": 0.2545662498474121,
377
+ "step": 1200
378
+ },
379
+ {
380
+ "epoch": 0.9911003236245954,
381
+ "grad_norm": 8.784140586853027,
382
+ "learning_rate": 1.8701141752722966e-05,
383
+ "loss": 0.15711795806884765,
384
+ "step": 1225
385
+ },
386
+ {
387
+ "epoch": 1.0113268608414239,
388
+ "grad_norm": 6.048089504241943,
389
+ "learning_rate": 1.8612806007233382e-05,
390
+ "loss": 0.18027606964111328,
391
+ "step": 1250
392
+ },
393
+ {
394
+ "epoch": 1.0315533980582525,
395
+ "grad_norm": 2.1826491355895996,
396
+ "learning_rate": 1.8521787431876954e-05,
397
+ "loss": 0.1467225170135498,
398
+ "step": 1275
399
+ },
400
+ {
401
+ "epoch": 1.051779935275081,
402
+ "grad_norm": 13.113622665405273,
403
+ "learning_rate": 1.8428114378314237e-05,
404
+ "loss": 0.21480131149291992,
405
+ "step": 1300
406
+ },
407
+ {
408
+ "epoch": 1.0720064724919094,
409
+ "grad_norm": 6.212342262268066,
410
+ "learning_rate": 1.8331816025057508e-05,
411
+ "loss": 0.22947580337524415,
412
+ "step": 1325
413
+ },
414
+ {
415
+ "epoch": 1.0922330097087378,
416
+ "grad_norm": 0.22277741134166718,
417
+ "learning_rate": 1.823292236838186e-05,
418
+ "loss": 0.10173338890075684,
419
+ "step": 1350
420
+ },
421
+ {
422
+ "epoch": 1.1124595469255663,
423
+ "grad_norm": 11.058046340942383,
424
+ "learning_rate": 1.813146421298154e-05,
425
+ "loss": 0.2582175064086914,
426
+ "step": 1375
427
+ },
428
+ {
429
+ "epoch": 1.132686084142395,
430
+ "grad_norm": 9.502155303955078,
431
+ "learning_rate": 1.802747316237454e-05,
432
+ "loss": 0.23467300415039063,
433
+ "step": 1400
434
+ },
435
+ {
436
+ "epoch": 1.1529126213592233,
437
+ "grad_norm": 5.091904640197754,
438
+ "learning_rate": 1.792098160905829e-05,
439
+ "loss": 0.18842180252075194,
440
+ "step": 1425
441
+ },
442
+ {
443
+ "epoch": 1.1731391585760518,
444
+ "grad_norm": 0.2650909721851349,
445
+ "learning_rate": 1.7812022724419624e-05,
446
+ "loss": 0.13545321464538573,
447
+ "step": 1450
448
+ },
449
+ {
450
+ "epoch": 1.1933656957928802,
451
+ "grad_norm": 3.7782185077667236,
452
+ "learning_rate": 1.7700630448402125e-05,
453
+ "loss": 0.16887168884277343,
454
+ "step": 1475
455
+ },
456
+ {
457
+ "epoch": 1.2135922330097086,
458
+ "grad_norm": 0.5704866051673889,
459
+ "learning_rate": 1.758683947893406e-05,
460
+ "loss": 0.22910015106201173,
461
+ "step": 1500
462
+ },
463
+ {
464
+ "epoch": 1.2135922330097086,
465
+ "eval_accuracy": 0.9605861546235472,
466
+ "eval_f1": 0.974559686888454,
467
+ "eval_loss": 0.14868734776973724,
468
+ "eval_precision": 0.9589216944801027,
469
+ "eval_recall": 0.9907161803713528,
470
+ "eval_runtime": 34.2705,
471
+ "eval_samples_per_second": 57.746,
472
+ "eval_steps_per_second": 3.618,
473
+ "step": 1500
474
+ },
475
+ {
476
+ "epoch": 1.2338187702265373,
477
+ "grad_norm": 16.6047306060791,
478
+ "learning_rate": 1.747068526112022e-05,
479
+ "loss": 0.14131352424621582,
480
+ "step": 1525
481
+ },
482
+ {
483
+ "epoch": 1.2540453074433657,
484
+ "grad_norm": 5.992398262023926,
485
+ "learning_rate": 1.735220397620101e-05,
486
+ "loss": 0.15291913986206054,
487
+ "step": 1550
488
+ },
489
+ {
490
+ "epoch": 1.2742718446601942,
491
+ "grad_norm": 0.36782047152519226,
492
+ "learning_rate": 1.7231432530282246e-05,
493
+ "loss": 0.09922373771667481,
494
+ "step": 1575
495
+ },
496
+ {
497
+ "epoch": 1.2944983818770226,
498
+ "grad_norm": 1.3172669410705566,
499
+ "learning_rate": 1.7108408542839146e-05,
500
+ "loss": 0.1941922378540039,
501
+ "step": 1600
502
+ },
503
+ {
504
+ "epoch": 1.3147249190938513,
505
+ "grad_norm": 0.693942666053772,
506
+ "learning_rate": 1.698317033499813e-05,
507
+ "loss": 0.16940629959106446,
508
+ "step": 1625
509
+ },
510
+ {
511
+ "epoch": 1.3349514563106797,
512
+ "grad_norm": 0.1476801335811615,
513
+ "learning_rate": 1.6855756917600057e-05,
514
+ "loss": 0.12692631721496583,
515
+ "step": 1650
516
+ },
517
+ {
518
+ "epoch": 1.3551779935275081,
519
+ "grad_norm": 23.20606231689453,
520
+ "learning_rate": 1.6726207979048604e-05,
521
+ "loss": 0.25180328369140625,
522
+ "step": 1675
523
+ },
524
+ {
525
+ "epoch": 1.3754045307443366,
526
+ "grad_norm": 0.3847394287586212,
527
+ "learning_rate": 1.6594563872947613e-05,
528
+ "loss": 0.13337421417236328,
529
+ "step": 1700
530
+ },
531
+ {
532
+ "epoch": 1.395631067961165,
533
+ "grad_norm": 7.629310131072998,
534
+ "learning_rate": 1.6460865605531214e-05,
535
+ "loss": 0.17984333038330078,
536
+ "step": 1725
537
+ },
538
+ {
539
+ "epoch": 1.4158576051779934,
540
+ "grad_norm": 0.40370574593544006,
541
+ "learning_rate": 1.6325154822890663e-05,
542
+ "loss": 0.15392546653747557,
543
+ "step": 1750
544
+ },
545
+ {
546
+ "epoch": 1.436084142394822,
547
+ "grad_norm": 3.1435182094573975,
548
+ "learning_rate": 1.618747379800188e-05,
549
+ "loss": 0.1560378646850586,
550
+ "step": 1775
551
+ },
552
+ {
553
+ "epoch": 1.4563106796116505,
554
+ "grad_norm": 6.557313919067383,
555
+ "learning_rate": 1.6047865417557695e-05,
556
+ "loss": 0.23071422576904296,
557
+ "step": 1800
558
+ },
559
+ {
560
+ "epoch": 1.476537216828479,
561
+ "grad_norm": 4.851151943206787,
562
+ "learning_rate": 1.5906373168608952e-05,
563
+ "loss": 0.17919015884399414,
564
+ "step": 1825
565
+ },
566
+ {
567
+ "epoch": 1.4967637540453074,
568
+ "grad_norm": 6.987358093261719,
569
+ "learning_rate": 1.576304112501858e-05,
570
+ "loss": 0.22098312377929688,
571
+ "step": 1850
572
+ },
573
+ {
574
+ "epoch": 1.516990291262136,
575
+ "grad_norm": 4.638033390045166,
576
+ "learning_rate": 1.5617913933732892e-05,
577
+ "loss": 0.1659644889831543,
578
+ "step": 1875
579
+ },
580
+ {
581
+ "epoch": 1.5372168284789645,
582
+ "grad_norm": 3.2221922874450684,
583
+ "learning_rate": 1.5471036800874375e-05,
584
+ "loss": 0.18479549407958984,
585
+ "step": 1900
586
+ },
587
+ {
588
+ "epoch": 1.557443365695793,
589
+ "grad_norm": 0.3064526617527008,
590
+ "learning_rate": 1.5322455477660274e-05,
591
+ "loss": 0.18851667404174804,
592
+ "step": 1925
593
+ },
594
+ {
595
+ "epoch": 1.5776699029126213,
596
+ "grad_norm": 15.610395431518555,
597
+ "learning_rate": 1.5172216246151426e-05,
598
+ "loss": 0.23035451889038086,
599
+ "step": 1950
600
+ },
601
+ {
602
+ "epoch": 1.5978964401294498,
603
+ "grad_norm": 8.045638084411621,
604
+ "learning_rate": 1.50203659048357e-05,
605
+ "loss": 0.05388895988464355,
606
+ "step": 1975
607
+ },
608
+ {
609
+ "epoch": 1.6181229773462782,
610
+ "grad_norm": 12.035682678222656,
611
+ "learning_rate": 1.4866951754050605e-05,
612
+ "loss": 0.2584081268310547,
613
+ "step": 2000
614
+ },
615
+ {
616
+ "epoch": 1.6181229773462782,
617
+ "eval_accuracy": 0.9621020717534108,
618
+ "eval_f1": 0.9754661432777233,
619
+ "eval_loss": 0.145921990275383,
620
+ "eval_precision": 0.9625564880568108,
621
+ "eval_recall": 0.9887267904509284,
622
+ "eval_runtime": 34.2514,
623
+ "eval_samples_per_second": 57.779,
624
+ "eval_steps_per_second": 3.62,
625
+ "step": 2000
626
+ },
627
+ {
628
+ "epoch": 1.6383495145631068,
629
+ "grad_norm": 11.77345085144043,
630
+ "learning_rate": 1.4712021581249534e-05,
631
+ "loss": 0.17600563049316406,
632
+ "step": 2025
633
+ },
634
+ {
635
+ "epoch": 1.6585760517799353,
636
+ "grad_norm": 0.31589698791503906,
637
+ "learning_rate": 1.4555623646116325e-05,
638
+ "loss": 0.2075064277648926,
639
+ "step": 2050
640
+ },
641
+ {
642
+ "epoch": 1.6788025889967637,
643
+ "grad_norm": 6.368648529052734,
644
+ "learning_rate": 1.4397806665532693e-05,
645
+ "loss": 0.15077384948730468,
646
+ "step": 2075
647
+ },
648
+ {
649
+ "epoch": 1.6990291262135924,
650
+ "grad_norm": 0.19168436527252197,
651
+ "learning_rate": 1.4238619798403266e-05,
652
+ "loss": 0.21610870361328124,
653
+ "step": 2100
654
+ },
655
+ {
656
+ "epoch": 1.7192556634304208,
657
+ "grad_norm": 3.6846413612365723,
658
+ "learning_rate": 1.4078112630342891e-05,
659
+ "loss": 0.1896487808227539,
660
+ "step": 2125
661
+ },
662
+ {
663
+ "epoch": 1.7394822006472492,
664
+ "grad_norm": 6.122201919555664,
665
+ "learning_rate": 1.3916335158231101e-05,
666
+ "loss": 0.18662324905395508,
667
+ "step": 2150
668
+ },
669
+ {
670
+ "epoch": 1.7597087378640777,
671
+ "grad_norm": 8.101036071777344,
672
+ "learning_rate": 1.3753337774638397e-05,
673
+ "loss": 0.14516648292541504,
674
+ "step": 2175
675
+ },
676
+ {
677
+ "epoch": 1.779935275080906,
678
+ "grad_norm": 0.39058423042297363,
679
+ "learning_rate": 1.3589171252129329e-05,
680
+ "loss": 0.23894359588623046,
681
+ "step": 2200
682
+ },
683
+ {
684
+ "epoch": 1.8001618122977345,
685
+ "grad_norm": 20.84650993347168,
686
+ "learning_rate": 1.3423886727447176e-05,
687
+ "loss": 0.16099306106567382,
688
+ "step": 2225
689
+ },
690
+ {
691
+ "epoch": 1.820388349514563,
692
+ "grad_norm": 2.713047504425049,
693
+ "learning_rate": 1.325753568558521e-05,
694
+ "loss": 0.23093647003173828,
695
+ "step": 2250
696
+ },
697
+ {
698
+ "epoch": 1.8406148867313916,
699
+ "grad_norm": 2.291496515274048,
700
+ "learning_rate": 1.3090169943749475e-05,
701
+ "loss": 0.14622759819030762,
702
+ "step": 2275
703
+ },
704
+ {
705
+ "epoch": 1.86084142394822,
706
+ "grad_norm": 0.38880622386932373,
707
+ "learning_rate": 1.2921841635218082e-05,
708
+ "loss": 0.14002437591552735,
709
+ "step": 2300
710
+ },
711
+ {
712
+ "epoch": 1.8810679611650487,
713
+ "grad_norm": 0.3293047249317169,
714
+ "learning_rate": 1.275260319310205e-05,
715
+ "loss": 0.21583776473999022,
716
+ "step": 2325
717
+ },
718
+ {
719
+ "epoch": 1.9012944983818771,
720
+ "grad_norm": 0.16572241485118866,
721
+ "learning_rate": 1.2582507334012755e-05,
722
+ "loss": 0.17850372314453125,
723
+ "step": 2350
724
+ },
725
+ {
726
+ "epoch": 1.9215210355987056,
727
+ "grad_norm": 4.988359451293945,
728
+ "learning_rate": 1.2411607041641062e-05,
729
+ "loss": 0.16260711669921876,
730
+ "step": 2375
731
+ },
732
+ {
733
+ "epoch": 1.941747572815534,
734
+ "grad_norm": 1.0162508487701416,
735
+ "learning_rate": 1.2239955550253277e-05,
736
+ "loss": 0.20481142044067382,
737
+ "step": 2400
738
+ },
739
+ {
740
+ "epoch": 1.9619741100323624,
741
+ "grad_norm": 0.41159898042678833,
742
+ "learning_rate": 1.2067606328109038e-05,
743
+ "loss": 0.12820093154907228,
744
+ "step": 2425
745
+ },
746
+ {
747
+ "epoch": 1.9822006472491909,
748
+ "grad_norm": 6.16225528717041,
749
+ "learning_rate": 1.1894613060806312e-05,
750
+ "loss": 0.18930299758911132,
751
+ "step": 2450
752
+ },
753
+ {
754
+ "epoch": 2.0024271844660193,
755
+ "grad_norm": 1.239059329032898,
756
+ "learning_rate": 1.172102963455871e-05,
757
+ "loss": 0.11151561737060547,
758
+ "step": 2475
759
+ },
760
+ {
761
+ "epoch": 2.0226537216828477,
762
+ "grad_norm": 0.14050441980361938,
763
+ "learning_rate": 1.1546910119410297e-05,
764
+ "loss": 0.07747174263000488,
765
+ "step": 2500
766
+ },
767
+ {
768
+ "epoch": 2.0226537216828477,
769
+ "eval_accuracy": 0.966144517433047,
770
+ "eval_f1": 0.977938755350675,
771
+ "eval_loss": 0.17465205490589142,
772
+ "eval_precision": 0.9712230215827338,
773
+ "eval_recall": 0.9847480106100795,
774
+ "eval_runtime": 34.5204,
775
+ "eval_samples_per_second": 57.328,
776
+ "eval_steps_per_second": 3.592,
777
+ "step": 2500
778
+ },
779
+ {
780
+ "epoch": 2.042880258899676,
781
+ "grad_norm": 0.5169682502746582,
782
+ "learning_rate": 1.1372308752393144e-05,
783
+ "loss": 0.12494021415710449,
784
+ "step": 2525
785
+ },
786
+ {
787
+ "epoch": 2.063106796116505,
788
+ "grad_norm": 2.469010829925537,
789
+ "learning_rate": 1.1197279920632864e-05,
790
+ "loss": 0.17911155700683593,
791
+ "step": 2550
792
+ },
793
+ {
794
+ "epoch": 2.0833333333333335,
795
+ "grad_norm": 0.20758801698684692,
796
+ "learning_rate": 1.1021878144407408e-05,
797
+ "loss": 0.1611471939086914,
798
+ "step": 2575
799
+ },
800
+ {
801
+ "epoch": 2.103559870550162,
802
+ "grad_norm": 18.897438049316406,
803
+ "learning_rate": 1.0846158060164359e-05,
804
+ "loss": 0.09400986671447754,
805
+ "step": 2600
806
+ },
807
+ {
808
+ "epoch": 2.1237864077669903,
809
+ "grad_norm": 0.48710235953330994,
810
+ "learning_rate": 1.0670174403502051e-05,
811
+ "loss": 0.10660056114196777,
812
+ "step": 2625
813
+ },
814
+ {
815
+ "epoch": 2.144012944983819,
816
+ "grad_norm": 5.023293972015381,
817
+ "learning_rate": 1.0493981992119833e-05,
818
+ "loss": 0.09857481956481934,
819
+ "step": 2650
820
+ },
821
+ {
822
+ "epoch": 2.164239482200647,
823
+ "grad_norm": 0.3322446942329407,
824
+ "learning_rate": 1.03176357087427e-05,
825
+ "loss": 0.1647811508178711,
826
+ "step": 2675
827
+ },
828
+ {
829
+ "epoch": 2.1844660194174756,
830
+ "grad_norm": 33.930667877197266,
831
+ "learning_rate": 1.0141190484025722e-05,
832
+ "loss": 0.21691896438598632,
833
+ "step": 2700
834
+ },
835
+ {
836
+ "epoch": 2.204692556634304,
837
+ "grad_norm": 0.22541019320487976,
838
+ "learning_rate": 9.964701279443509e-06,
839
+ "loss": 0.20835105895996095,
840
+ "step": 2725
841
+ },
842
+ {
843
+ "epoch": 2.2249190938511325,
844
+ "grad_norm": 0.2086869329214096,
845
+ "learning_rate": 9.788223070170112e-06,
846
+ "loss": 0.1038576602935791,
847
+ "step": 2750
848
+ },
849
+ {
850
+ "epoch": 2.2451456310679614,
851
+ "grad_norm": 1.6252963542938232,
852
+ "learning_rate": 9.6118108279546e-06,
853
+ "loss": 0.1402608013153076,
854
+ "step": 2775
855
+ },
856
+ {
857
+ "epoch": 2.26537216828479,
858
+ "grad_norm": 1.1920742988586426,
859
+ "learning_rate": 9.435519503997767e-06,
860
+ "loss": 0.1478741455078125,
861
+ "step": 2800
862
+ },
863
+ {
864
+ "epoch": 2.2855987055016183,
865
+ "grad_norm": 0.6118252277374268,
866
+ "learning_rate": 9.259404011835203e-06,
867
+ "loss": 0.10929722785949707,
868
+ "step": 2825
869
+ },
870
+ {
871
+ "epoch": 2.3058252427184467,
872
+ "grad_norm": 0.16680538654327393,
873
+ "learning_rate": 9.083519210232096e-06,
874
+ "loss": 0.11905492782592773,
875
+ "step": 2850
876
+ },
877
+ {
878
+ "epoch": 2.326051779935275,
879
+ "grad_norm": 0.19600656628608704,
880
+ "learning_rate": 8.907919886095115e-06,
881
+ "loss": 0.08101269721984863,
882
+ "step": 2875
883
+ },
884
+ {
885
+ "epoch": 2.3462783171521036,
886
+ "grad_norm": 1.6680601835250854,
887
+ "learning_rate": 8.732660737406663e-06,
888
+ "loss": 0.09864620208740234,
889
+ "step": 2900
890
+ },
891
+ {
892
+ "epoch": 2.366504854368932,
893
+ "grad_norm": 0.5449312925338745,
894
+ "learning_rate": 8.557796356186818e-06,
895
+ "loss": 0.16998577117919922,
896
+ "step": 2925
897
+ },
898
+ {
899
+ "epoch": 2.3867313915857604,
900
+ "grad_norm": 0.10003538429737091,
901
+ "learning_rate": 8.383381211488321e-06,
902
+ "loss": 0.23032936096191406,
903
+ "step": 2950
904
+ },
905
+ {
906
+ "epoch": 2.406957928802589,
907
+ "grad_norm": 7.103508472442627,
908
+ "learning_rate": 8.209469632429811e-06,
909
+ "loss": 0.08545310974121094,
910
+ "step": 2975
911
+ },
912
+ {
913
+ "epoch": 2.4271844660194173,
914
+ "grad_norm": 6.692376136779785,
915
+ "learning_rate": 8.036115791272697e-06,
916
+ "loss": 0.2049958038330078,
917
+ "step": 3000
918
+ },
919
+ {
920
+ "epoch": 2.4271844660194173,
921
+ "eval_accuracy": 0.9631126831733199,
922
+ "eval_f1": 0.9761047463175123,
923
+ "eval_loss": 0.1759410947561264,
924
+ "eval_precision": 0.9638009049773756,
925
+ "eval_recall": 0.9887267904509284,
926
+ "eval_runtime": 34.2085,
927
+ "eval_samples_per_second": 57.851,
928
+ "eval_steps_per_second": 3.625,
929
+ "step": 3000
930
+ },
931
+ {
932
+ "epoch": 2.4474110032362457,
933
+ "grad_norm": 11.302281379699707,
934
+ "learning_rate": 7.863373686546868e-06,
935
+ "loss": 0.21097312927246092,
936
+ "step": 3025
937
+ },
938
+ {
939
+ "epoch": 2.4676375404530746,
940
+ "grad_norm": 5.9209113121032715,
941
+ "learning_rate": 7.691297126230515e-06,
942
+ "loss": 0.12400970458984376,
943
+ "step": 3050
944
+ },
945
+ {
946
+ "epoch": 2.487864077669903,
947
+ "grad_norm": 15.600579261779785,
948
+ "learning_rate": 7.519939710989326e-06,
949
+ "loss": 0.20074039459228515,
950
+ "step": 3075
951
+ },
952
+ {
953
+ "epoch": 2.5080906148867315,
954
+ "grad_norm": 14.571202278137207,
955
+ "learning_rate": 7.349354817480234e-06,
956
+ "loss": 0.0825264072418213,
957
+ "step": 3100
958
+ },
959
+ {
960
+ "epoch": 2.52831715210356,
961
+ "grad_norm": 0.2681007981300354,
962
+ "learning_rate": 7.179595581724971e-06,
963
+ "loss": 0.13173922538757324,
964
+ "step": 3125
965
+ },
966
+ {
967
+ "epoch": 2.5485436893203883,
968
+ "grad_norm": 0.1719094216823578,
969
+ "learning_rate": 7.010714882558551e-06,
970
+ "loss": 0.09000961303710937,
971
+ "step": 3150
972
+ },
973
+ {
974
+ "epoch": 2.5687702265372168,
975
+ "grad_norm": 0.06844039261341095,
976
+ "learning_rate": 6.842765325157874e-06,
977
+ "loss": 0.13644008636474608,
978
+ "step": 3175
979
+ },
980
+ {
981
+ "epoch": 2.588996763754045,
982
+ "grad_norm": 11.590834617614746,
983
+ "learning_rate": 6.675799224655588e-06,
984
+ "loss": 0.07055030345916748,
985
+ "step": 3200
986
+ },
987
+ {
988
+ "epoch": 2.6092233009708736,
989
+ "grad_norm": 0.16210342943668365,
990
+ "learning_rate": 6.509868589844274e-06,
991
+ "loss": 0.10780407905578614,
992
+ "step": 3225
993
+ },
994
+ {
995
+ "epoch": 2.6294498381877025,
996
+ "grad_norm": 0.1514226347208023,
997
+ "learning_rate": 6.34502510697607e-06,
998
+ "loss": 0.06451849937438965,
999
+ "step": 3250
1000
+ },
1001
+ {
1002
+ "epoch": 2.649676375404531,
1003
+ "grad_norm": 0.14009274542331696,
1004
+ "learning_rate": 6.181320123662755e-06,
1005
+ "loss": 0.13269135475158692,
1006
+ "step": 3275
1007
+ },
1008
+ {
1009
+ "epoch": 2.6699029126213594,
1010
+ "grad_norm": 1.227739930152893,
1011
+ "learning_rate": 6.018804632881326e-06,
1012
+ "loss": 0.1452858829498291,
1013
+ "step": 3300
1014
+ },
1015
+ {
1016
+ "epoch": 2.690129449838188,
1017
+ "grad_norm": 0.12412651628255844,
1018
+ "learning_rate": 5.857529257090027e-06,
1019
+ "loss": 0.11763744354248047,
1020
+ "step": 3325
1021
+ },
1022
+ {
1023
+ "epoch": 2.7103559870550162,
1024
+ "grad_norm": 9.471817016601562,
1025
+ "learning_rate": 5.6975442324598165e-06,
1026
+ "loss": 0.10433626174926758,
1027
+ "step": 3350
1028
+ },
1029
+ {
1030
+ "epoch": 2.7305825242718447,
1031
+ "grad_norm": 5.368896961212158,
1032
+ "learning_rate": 5.538899393226122e-06,
1033
+ "loss": 0.14967796325683594,
1034
+ "step": 3375
1035
+ },
1036
+ {
1037
+ "epoch": 2.750809061488673,
1038
+ "grad_norm": 0.7815220355987549,
1039
+ "learning_rate": 5.381644156165844e-06,
1040
+ "loss": 0.13424870491027832,
1041
+ "step": 3400
1042
+ },
1043
+ {
1044
+ "epoch": 2.7710355987055015,
1045
+ "grad_norm": 17.132827758789062,
1046
+ "learning_rate": 5.225827505204355e-06,
1047
+ "loss": 0.12580464363098146,
1048
+ "step": 3425
1049
+ },
1050
+ {
1051
+ "epoch": 2.79126213592233,
1052
+ "grad_norm": 2.3049182891845703,
1053
+ "learning_rate": 5.071497976157346e-06,
1054
+ "loss": 0.18594202041625976,
1055
+ "step": 3450
1056
+ },
1057
+ {
1058
+ "epoch": 2.8114886731391584,
1059
+ "grad_norm": 9.519274711608887,
1060
+ "learning_rate": 4.918703641612255e-06,
1061
+ "loss": 0.14881797790527343,
1062
+ "step": 3475
1063
+ },
1064
+ {
1065
+ "epoch": 2.831715210355987,
1066
+ "grad_norm": 7.568735599517822,
1067
+ "learning_rate": 4.767492095953985e-06,
1068
+ "loss": 0.10424537658691406,
1069
+ "step": 3500
1070
+ },
1071
+ {
1072
+ "epoch": 2.831715210355987,
1073
+ "eval_accuracy": 0.9676604345629105,
1074
+ "eval_f1": 0.9789335088874259,
1075
+ "eval_loss": 0.1581990271806717,
1076
+ "eval_precision": 0.9718954248366013,
1077
+ "eval_recall": 0.9860742705570292,
1078
+ "eval_runtime": 34.2504,
1079
+ "eval_samples_per_second": 57.78,
1080
+ "eval_steps_per_second": 3.62,
1081
+ "step": 3500
1082
+ }
1083
+ ],
1084
+ "logging_steps": 25,
1085
+ "max_steps": 4944,
1086
+ "num_input_tokens_seen": 0,
1087
+ "num_train_epochs": 4,
1088
+ "save_steps": 500,
1089
+ "stateful_callbacks": {
1090
+ "EarlyStoppingCallback": {
1091
+ "args": {
1092
+ "early_stopping_patience": 2,
1093
+ "early_stopping_threshold": 0.0
1094
+ },
1095
+ "attributes": {
1096
+ "early_stopping_patience_counter": 0
1097
+ }
1098
+ },
1099
+ "TrainerControl": {
1100
+ "args": {
1101
+ "should_epoch_stop": false,
1102
+ "should_evaluate": false,
1103
+ "should_log": false,
1104
+ "should_save": true,
1105
+ "should_training_stop": false
1106
+ },
1107
+ "attributes": {}
1108
+ }
1109
+ },
1110
+ "total_flos": 1.472790443483136e+16,
1111
+ "train_batch_size": 16,
1112
+ "trial_name": null,
1113
+ "trial_params": null
1114
+ }
checkpoint-3500/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6356dffa425669d6696f329ab57522ceda02ab7fadb057794c10a172cb56de1f
3
+ size 5201