xshubhamx commited on
Commit
aefbb83
·
verified ·
1 Parent(s): d4d41c0

Upload folder using huggingface_hub

Browse files
training_checkpoints/checkpoint-9645/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f3fce45b115b232a03755bc389bf96ae449717fb4e34dd6f0815441f86e005e0
3
  size 498652812
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d5a43044f3883b5937338842d04d582eea99655defaa4ff1e77553e429df37f9
3
  size 498652812
training_checkpoints/checkpoint-9645/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:aeadf0536441f75b4bab51564512611c8b0488ba60b41cc25c020d21e38ca40b
3
  size 997425402
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ed8dd2655c8a3227c36f2923c26e803748cf4f8ce86e33ff2419fb6a235f566f
3
  size 997425402
training_checkpoints/checkpoint-9645/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2fe148baf5ae4abec5ba0f1cd141ef03f380ade8d0f9fa21aa75fa9ef31a6675
3
  size 14244
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2623804f91f689ff1e336231975ac841f18f91a752aa8dc11c4b026dff4a80b8
3
  size 14244
training_checkpoints/checkpoint-9645/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:05ce34d26c60a61f9275f5b7997ecbd615a6dc14ec6c37d3e624bdcc1c4a6f10
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bb87ef656eef2e06eb1a123d6b14bdd40712b87ff8494549a22ba029d8fac413
3
  size 1064
training_checkpoints/checkpoint-9645/trainer_state.json CHANGED
@@ -1,6 +1,6 @@
1
  {
2
- "best_metric": 0.3416002470875682,
3
- "best_model_checkpoint": "roberta-base/checkpoint-9645",
4
  "epoch": 15.0,
5
  "eval_steps": 500,
6
  "global_step": 9645,
@@ -10,465 +10,465 @@
10
  "log_history": [
11
  {
12
  "epoch": 0.78,
13
- "grad_norm": 6.534026145935059,
14
  "learning_rate": 4.742871954380509e-05,
15
- "loss": 2.2214,
16
  "step": 500
17
  },
18
  {
19
  "epoch": 1.0,
20
- "eval_accuracy": 0.24554608830364058,
21
- "eval_f1_macro": 0.02628524046434494,
22
- "eval_f1_micro": 0.24554608830364058,
23
- "eval_f1_weighted": 0.09681356964210704,
24
- "eval_loss": 2.1982107162475586,
25
- "eval_macro_fpr": 0.06666666666666667,
26
- "eval_macro_sensitivity": 0.06666666666666667,
27
- "eval_macro_specificity": 0.9333333333333333,
28
- "eval_precision": 0.06029288148121926,
29
- "eval_precision_macro": 0.016369739220242704,
30
- "eval_recall": 0.24554608830364058,
31
- "eval_recall_macro": 0.06666666666666667,
32
- "eval_runtime": 29.4439,
33
- "eval_samples_per_second": 43.846,
34
- "eval_steps_per_second": 5.502,
35
- "eval_weighted_fpr": 0.17997043606799704,
36
- "eval_weighted_sensitivity": 0.24554608830364058,
37
- "eval_weighted_specificity": 0.7544539116963594,
38
  "step": 643
39
  },
40
  {
41
  "epoch": 1.56,
42
- "grad_norm": 6.595059871673584,
43
  "learning_rate": 4.483670295489891e-05,
44
- "loss": 2.1462,
45
  "step": 1000
46
  },
47
  {
48
  "epoch": 2.0,
49
- "eval_accuracy": 0.3361735089078234,
50
- "eval_f1_macro": 0.06552880630375763,
51
- "eval_f1_micro": 0.3361735089078234,
52
- "eval_f1_weighted": 0.2010480796875688,
53
- "eval_loss": 1.9634978771209717,
54
- "eval_macro_fpr": 0.09092506634165738,
55
- "eval_macro_sensitivity": 0.11547020741602194,
56
- "eval_macro_specificity": 0.9457066851291582,
57
- "eval_precision": 0.1591168191834871,
58
- "eval_precision_macro": 0.05308920125936356,
59
- "eval_recall": 0.3361735089078234,
60
- "eval_recall_macro": 0.11547020741602194,
61
- "eval_runtime": 57.2389,
62
- "eval_samples_per_second": 22.555,
63
- "eval_steps_per_second": 2.83,
64
- "eval_weighted_fpr": 0.12361171210154334,
65
- "eval_weighted_sensitivity": 0.3361735089078234,
66
- "eval_weighted_specificity": 0.84942676802955,
67
  "step": 1286
68
  },
69
  {
70
  "epoch": 2.33,
71
- "grad_norm": 41.05898666381836,
72
- "learning_rate": 4.224987039917055e-05,
73
- "loss": 1.995,
74
  "step": 1500
75
  },
76
  {
77
  "epoch": 3.0,
78
- "eval_accuracy": 0.3555383423702556,
79
- "eval_f1_macro": 0.09312335075016234,
80
- "eval_f1_micro": 0.3555383423702556,
81
- "eval_f1_weighted": 0.2541975590745503,
82
- "eval_loss": 1.932247281074524,
83
- "eval_macro_fpr": 0.09537141294157879,
84
- "eval_macro_sensitivity": 0.14351969127084646,
85
- "eval_macro_specificity": 0.9497795632717652,
86
- "eval_precision": 0.23412920314698393,
87
- "eval_precision_macro": 0.09260367628400626,
88
- "eval_recall": 0.3555383423702556,
89
- "eval_recall_macro": 0.14351969127084646,
90
- "eval_runtime": 59.8887,
91
- "eval_samples_per_second": 21.557,
92
- "eval_steps_per_second": 2.705,
93
- "eval_weighted_fpr": 0.11463213006337834,
94
- "eval_weighted_sensitivity": 0.3555383423702556,
95
- "eval_weighted_specificity": 0.8911551067062222,
96
  "step": 1929
97
  },
98
  {
99
  "epoch": 3.11,
100
- "grad_norm": 4.287881851196289,
101
- "learning_rate": 3.96630378434422e-05,
102
- "loss": 2.0064,
103
  "step": 2000
104
  },
105
  {
106
  "epoch": 3.89,
107
- "grad_norm": 5.713494777679443,
108
- "learning_rate": 3.7076205287713846e-05,
109
- "loss": 1.8909,
110
  "step": 2500
111
  },
112
  {
113
  "epoch": 4.0,
114
- "eval_accuracy": 0.3787761425251743,
115
- "eval_f1_macro": 0.14496386130680605,
116
- "eval_f1_micro": 0.3787761425251743,
117
- "eval_f1_weighted": 0.29773714484044667,
118
- "eval_loss": 1.8874640464782715,
119
- "eval_macro_fpr": 0.08706956494211866,
120
- "eval_macro_sensitivity": 0.2191470222337379,
121
- "eval_macro_specificity": 0.9525422186332462,
122
- "eval_precision": 0.28749388015966415,
123
- "eval_precision_macro": 0.12703293957809556,
124
- "eval_recall": 0.3787761425251743,
125
- "eval_recall_macro": 0.2191470222337379,
126
- "eval_runtime": 69.4305,
127
- "eval_samples_per_second": 18.594,
128
- "eval_steps_per_second": 2.333,
129
- "eval_weighted_fpr": 0.10486401673640168,
130
- "eval_weighted_sensitivity": 0.3787761425251743,
131
- "eval_weighted_specificity": 0.9093571369735185,
132
  "step": 2572
133
  },
134
  {
135
  "epoch": 4.67,
136
- "grad_norm": 18.91859245300293,
137
- "learning_rate": 3.4484188698807675e-05,
138
- "loss": 1.7621,
139
  "step": 3000
140
  },
141
  {
142
  "epoch": 5.0,
143
- "eval_accuracy": 0.42835011618900076,
144
- "eval_f1_macro": 0.1745447316852942,
145
- "eval_f1_micro": 0.4283501161890007,
146
- "eval_f1_weighted": 0.3593798293323463,
147
- "eval_loss": 1.7168936729431152,
148
- "eval_macro_fpr": 0.07431772683182448,
149
- "eval_macro_sensitivity": 0.2270221309090987,
150
- "eval_macro_specificity": 0.95583829077833,
151
- "eval_precision": 0.374728097525222,
152
- "eval_precision_macro": 0.18202607308331148,
153
- "eval_recall": 0.42835011618900076,
154
- "eval_recall_macro": 0.2270221309090987,
155
- "eval_runtime": 58.7135,
156
- "eval_samples_per_second": 21.988,
157
- "eval_steps_per_second": 2.759,
158
- "eval_weighted_fpr": 0.08702830188679245,
159
- "eval_weighted_sensitivity": 0.42835011618900076,
160
- "eval_weighted_specificity": 0.9092242454859507,
161
  "step": 3215
162
  },
163
  {
164
  "epoch": 5.44,
165
- "grad_norm": 7.408999919891357,
166
- "learning_rate": 3.1892172109901504e-05,
167
- "loss": 1.6254,
168
  "step": 3500
169
  },
170
  {
171
  "epoch": 6.0,
172
- "eval_accuracy": 0.4500387296669249,
173
- "eval_f1_macro": 0.18588331301714964,
174
- "eval_f1_micro": 0.4500387296669249,
175
- "eval_f1_weighted": 0.39697994452590485,
176
- "eval_loss": 1.8831233978271484,
177
- "eval_macro_fpr": 0.07944022523045574,
178
- "eval_macro_sensitivity": 0.2544695464493438,
179
- "eval_macro_specificity": 0.9582711519830998,
180
- "eval_precision": 0.3947542941359455,
181
- "eval_precision_macro": 0.1877780146030796,
182
- "eval_recall": 0.4500387296669249,
183
- "eval_recall_macro": 0.2544695464493438,
184
- "eval_runtime": 65.7966,
185
- "eval_samples_per_second": 19.621,
186
- "eval_steps_per_second": 2.462,
187
- "eval_weighted_fpr": 0.08028041610131162,
188
- "eval_weighted_sensitivity": 0.4500387296669249,
189
- "eval_weighted_specificity": 0.92402855007957,
190
  "step": 3858
191
  },
192
  {
193
  "epoch": 6.22,
194
- "grad_norm": 8.139199256896973,
195
- "learning_rate": 2.9300155520995337e-05,
196
- "loss": 1.4996,
197
  "step": 4000
198
  },
199
  {
200
  "epoch": 7.0,
201
- "grad_norm": 40.22551727294922,
202
- "learning_rate": 2.671332296526698e-05,
203
- "loss": 1.4139,
204
  "step": 4500
205
  },
206
  {
207
  "epoch": 7.0,
208
- "eval_accuracy": 0.46398140975987606,
209
- "eval_f1_macro": 0.22845278849292336,
210
- "eval_f1_micro": 0.4639814097598761,
211
- "eval_f1_weighted": 0.4297793996222424,
212
- "eval_loss": 1.662539005279541,
213
- "eval_macro_fpr": 0.07171513504664777,
214
- "eval_macro_sensitivity": 0.2949397340388095,
215
- "eval_macro_specificity": 0.9601261188979237,
216
- "eval_precision": 0.451602882474783,
217
- "eval_precision_macro": 0.232765042661752,
218
- "eval_recall": 0.46398140975987606,
219
- "eval_recall_macro": 0.2949397340388095,
220
- "eval_runtime": 60.1854,
221
- "eval_samples_per_second": 21.45,
222
- "eval_steps_per_second": 2.692,
223
- "eval_weighted_fpr": 0.07622824410663141,
224
- "eval_weighted_sensitivity": 0.46398140975987606,
225
- "eval_weighted_specificity": 0.9379103737089811,
226
  "step": 4501
227
  },
228
  {
229
  "epoch": 7.78,
230
- "grad_norm": 5.4409565925598145,
231
- "learning_rate": 2.412130637636081e-05,
232
- "loss": 1.2681,
233
  "step": 5000
234
  },
235
  {
236
  "epoch": 8.0,
237
- "eval_accuracy": 0.5383423702556158,
238
- "eval_f1_macro": 0.2703391292878622,
239
- "eval_f1_micro": 0.5383423702556158,
240
- "eval_f1_weighted": 0.48876940771692845,
241
- "eval_loss": 1.4461586475372314,
242
- "eval_macro_fpr": 0.056020043825060734,
243
- "eval_macro_sensitivity": 0.3381295733874737,
244
- "eval_macro_specificity": 0.9655641856187219,
245
- "eval_precision": 0.5269280210096271,
246
- "eval_precision_macro": 0.2765942082966614,
247
- "eval_recall": 0.5383423702556158,
248
- "eval_recall_macro": 0.3381295733874737,
249
- "eval_runtime": 64.8556,
250
- "eval_samples_per_second": 19.906,
251
- "eval_steps_per_second": 2.498,
252
- "eval_weighted_fpr": 0.057718380786364515,
253
- "eval_weighted_sensitivity": 0.5383423702556158,
254
- "eval_weighted_specificity": 0.9451204140252133,
255
  "step": 5144
256
  },
257
  {
258
  "epoch": 8.55,
259
- "grad_norm": 6.948422908782959,
260
- "learning_rate": 2.152928978745464e-05,
261
- "loss": 1.2351,
262
  "step": 5500
263
  },
264
  {
265
  "epoch": 9.0,
266
- "eval_accuracy": 0.5515104570100697,
267
- "eval_f1_macro": 0.29219268534520737,
268
- "eval_f1_micro": 0.5515104570100697,
269
- "eval_f1_weighted": 0.5183378322557094,
270
- "eval_loss": 1.3802897930145264,
271
- "eval_macro_fpr": 0.05395959885799773,
272
- "eval_macro_sensitivity": 0.33994734275998406,
273
- "eval_macro_specificity": 0.966222282286659,
274
- "eval_precision": 0.5182882506526222,
275
- "eval_precision_macro": 0.2800150936557356,
276
- "eval_recall": 0.5515104570100697,
277
- "eval_recall_macro": 0.33994734275998406,
278
- "eval_runtime": 95.1023,
279
- "eval_samples_per_second": 13.575,
280
- "eval_steps_per_second": 1.703,
281
- "eval_weighted_fpr": 0.05489712714515976,
282
- "eval_weighted_sensitivity": 0.5515104570100697,
283
- "eval_weighted_specificity": 0.9418237772898147,
284
  "step": 5787
285
  },
286
  {
287
  "epoch": 9.33,
288
- "grad_norm": 17.84939956665039,
289
- "learning_rate": 1.8937273198548472e-05,
290
- "loss": 1.1161,
291
  "step": 6000
292
  },
293
  {
294
  "epoch": 10.0,
295
- "eval_accuracy": 0.5747482571649883,
296
- "eval_f1_macro": 0.3016038026372148,
297
- "eval_f1_micro": 0.5747482571649883,
298
- "eval_f1_weighted": 0.5350722531862059,
299
- "eval_loss": 1.3405604362487793,
300
- "eval_macro_fpr": 0.050184494231821634,
301
- "eval_macro_sensitivity": 0.35749011781425877,
302
- "eval_macro_specificity": 0.968005386818716,
303
- "eval_precision": 0.5342322193126818,
304
- "eval_precision_macro": 0.2899738892872161,
305
- "eval_recall": 0.5747482571649883,
306
- "eval_recall_macro": 0.35749011781425877,
307
- "eval_runtime": 59.1957,
308
- "eval_samples_per_second": 21.809,
309
- "eval_steps_per_second": 2.737,
310
- "eval_weighted_fpr": 0.05019658041510469,
311
- "eval_weighted_sensitivity": 0.5747482571649883,
312
- "eval_weighted_specificity": 0.945332545115751,
313
  "step": 6430
314
  },
315
  {
316
  "epoch": 10.11,
317
- "grad_norm": 34.46049499511719,
318
- "learning_rate": 1.6345256609642305e-05,
319
- "loss": 1.0384,
320
  "step": 6500
321
  },
322
  {
323
  "epoch": 10.89,
324
- "grad_norm": 18.093345642089844,
325
- "learning_rate": 1.3753240020736132e-05,
326
- "loss": 0.9747,
327
  "step": 7000
328
  },
329
  {
330
  "epoch": 11.0,
331
- "eval_accuracy": 0.6150271107668474,
332
- "eval_f1_macro": 0.3261856936782915,
333
- "eval_f1_micro": 0.6150271107668474,
334
- "eval_f1_weighted": 0.5766051994823087,
335
- "eval_loss": 1.380952000617981,
336
- "eval_macro_fpr": 0.0444013730647484,
337
- "eval_macro_sensitivity": 0.3747372380690592,
338
- "eval_macro_specificity": 0.9705808122777527,
339
- "eval_precision": 0.5606186818865333,
340
- "eval_precision_macro": 0.3083540755636765,
341
- "eval_recall": 0.6150271107668474,
342
- "eval_recall_macro": 0.3747372380690592,
343
- "eval_runtime": 54.8103,
344
- "eval_samples_per_second": 23.554,
345
- "eval_steps_per_second": 2.956,
346
- "eval_weighted_fpr": 0.04279686558167571,
347
- "eval_weighted_sensitivity": 0.6150271107668474,
348
- "eval_weighted_specificity": 0.9436850733994432,
349
  "step": 7073
350
  },
351
  {
352
  "epoch": 11.66,
353
- "grad_norm": 18.54058265686035,
354
- "learning_rate": 1.1161223431829965e-05,
355
- "loss": 0.9145,
356
  "step": 7500
357
  },
358
  {
359
  "epoch": 12.0,
360
- "eval_accuracy": 0.6196746707978311,
361
- "eval_f1_macro": 0.33300079962435747,
362
- "eval_f1_micro": 0.6196746707978311,
363
- "eval_f1_weighted": 0.5913426830324416,
364
- "eval_loss": 1.273578405380249,
365
- "eval_macro_fpr": 0.04205592092867989,
366
- "eval_macro_sensitivity": 0.38075990989198766,
367
- "eval_macro_specificity": 0.9713642071716353,
368
- "eval_precision": 0.5857440172055212,
369
- "eval_precision_macro": 0.3198823734674615,
370
- "eval_recall": 0.6196746707978311,
371
- "eval_recall_macro": 0.38075990989198766,
372
- "eval_runtime": 53.8432,
373
- "eval_samples_per_second": 23.977,
374
- "eval_steps_per_second": 3.009,
375
- "eval_weighted_fpr": 0.041998118210589346,
376
- "eval_weighted_sensitivity": 0.6196746707978311,
377
- "eval_weighted_specificity": 0.9507884367766963,
378
  "step": 7716
379
  },
380
  {
381
  "epoch": 12.44,
382
- "grad_norm": 2.550917863845825,
383
- "learning_rate": 8.574390876101608e-06,
384
- "loss": 0.8879,
385
  "step": 8000
386
  },
387
  {
388
  "epoch": 13.0,
389
- "eval_accuracy": 0.635166537567777,
390
- "eval_f1_macro": 0.3368012141860189,
391
- "eval_f1_micro": 0.635166537567777,
392
- "eval_f1_weighted": 0.6018918369596469,
393
- "eval_loss": 1.3463146686553955,
394
- "eval_macro_fpr": 0.039790684997017586,
395
- "eval_macro_sensitivity": 0.3876584042144534,
396
- "eval_macro_specificity": 0.972524656182703,
397
- "eval_precision": 0.591491914014134,
398
- "eval_precision_macro": 0.3194926993208432,
399
- "eval_recall": 0.635166537567777,
400
- "eval_recall_macro": 0.3876584042144534,
401
- "eval_runtime": 53.0494,
402
- "eval_samples_per_second": 24.336,
403
- "eval_steps_per_second": 3.054,
404
- "eval_weighted_fpr": 0.039410927955819595,
405
- "eval_weighted_sensitivity": 0.635166537567777,
406
- "eval_weighted_specificity": 0.9527033051727678,
407
  "step": 8359
408
  },
409
  {
410
  "epoch": 13.22,
411
- "grad_norm": 20.480079650878906,
412
- "learning_rate": 5.9823742871954386e-06,
413
- "loss": 0.818,
414
  "step": 8500
415
  },
416
  {
417
  "epoch": 14.0,
418
- "grad_norm": 23.086130142211914,
419
- "learning_rate": 3.390357698289269e-06,
420
- "loss": 0.8034,
421
  "step": 9000
422
  },
423
  {
424
  "epoch": 14.0,
425
- "eval_accuracy": 0.6312935708752905,
426
- "eval_f1_macro": 0.34083702910591834,
427
- "eval_f1_micro": 0.6312935708752905,
428
- "eval_f1_weighted": 0.6028724695599472,
429
- "eval_loss": 1.3203202486038208,
430
- "eval_macro_fpr": 0.04021000066286082,
431
- "eval_macro_sensitivity": 0.3887264350085824,
432
- "eval_macro_specificity": 0.9722365595844839,
433
- "eval_precision": 0.5912742157720344,
434
- "eval_precision_macro": 0.3223323142886684,
435
- "eval_recall": 0.6312935708752905,
436
- "eval_recall_macro": 0.3887264350085824,
437
- "eval_runtime": 53.2083,
438
- "eval_samples_per_second": 24.263,
439
- "eval_steps_per_second": 3.045,
440
- "eval_weighted_fpr": 0.04004711425206125,
441
- "eval_weighted_sensitivity": 0.6312935708752905,
442
- "eval_weighted_specificity": 0.9522548228919672,
443
  "step": 9002
444
  },
445
  {
446
  "epoch": 14.77,
447
- "grad_norm": 33.89963912963867,
448
- "learning_rate": 7.983411093831002e-07,
449
- "loss": 0.7438,
450
  "step": 9500
451
  },
452
  {
453
  "epoch": 15.0,
454
- "eval_accuracy": 0.6343919442292796,
455
- "eval_f1_macro": 0.3416002470875682,
456
- "eval_f1_micro": 0.6343919442292796,
457
- "eval_f1_weighted": 0.605100970801756,
458
- "eval_loss": 1.3312515020370483,
459
- "eval_macro_fpr": 0.03982433244262638,
460
- "eval_macro_sensitivity": 0.38980632312034796,
461
- "eval_macro_specificity": 0.9724569035536236,
462
- "eval_precision": 0.5926286717233002,
463
- "eval_precision_macro": 0.32309677130337533,
464
- "eval_recall": 0.6343919442292796,
465
- "eval_recall_macro": 0.38980632312034796,
466
- "eval_runtime": 59.3158,
467
- "eval_samples_per_second": 21.765,
468
- "eval_steps_per_second": 2.731,
469
- "eval_weighted_fpr": 0.039537610990115594,
470
- "eval_weighted_sensitivity": 0.6343919442292796,
471
- "eval_weighted_specificity": 0.9524616090750742,
472
  "step": 9645
473
  }
474
  ],
 
1
  {
2
+ "best_metric": 0.7850116201409046,
3
+ "best_model_checkpoint": "roberta-base/checkpoint-7073",
4
  "epoch": 15.0,
5
  "eval_steps": 500,
6
  "global_step": 9645,
 
10
  "log_history": [
11
  {
12
  "epoch": 0.78,
13
+ "grad_norm": 16.478424072265625,
14
  "learning_rate": 4.742871954380509e-05,
15
+ "loss": 1.4921,
16
  "step": 500
17
  },
18
  {
19
  "epoch": 1.0,
20
+ "eval_accuracy": 0.6762199845081333,
21
+ "eval_f1_macro": 0.36762215914350266,
22
+ "eval_f1_micro": 0.6762199845081333,
23
+ "eval_f1_weighted": 0.6381553142782734,
24
+ "eval_loss": 1.0307424068450928,
25
+ "eval_macro_fpr": 0.03508857639652692,
26
+ "eval_macro_sensitivity": 0.4027183655220987,
27
+ "eval_macro_specificity": 0.9746655126680946,
28
+ "eval_precision": 0.6361951106730956,
29
+ "eval_precision_macro": 0.3745780279088578,
30
+ "eval_recall": 0.6762199845081333,
31
+ "eval_recall_macro": 0.4027183655220987,
32
+ "eval_runtime": 65.0146,
33
+ "eval_samples_per_second": 19.857,
34
+ "eval_steps_per_second": 2.492,
35
+ "eval_weighted_fpr": 0.03306962025316456,
36
+ "eval_weighted_sensitivity": 0.6762199845081333,
37
+ "eval_weighted_specificity": 0.9437627055132857,
38
  "step": 643
39
  },
40
  {
41
  "epoch": 1.56,
42
+ "grad_norm": 11.052178382873535,
43
  "learning_rate": 4.483670295489891e-05,
44
+ "loss": 0.9019,
45
  "step": 1000
46
  },
47
  {
48
  "epoch": 2.0,
49
+ "eval_accuracy": 0.737412858249419,
50
+ "eval_f1_macro": 0.4767493392755858,
51
+ "eval_f1_micro": 0.737412858249419,
52
+ "eval_f1_weighted": 0.7197263095885438,
53
+ "eval_loss": 0.8135831952095032,
54
+ "eval_macro_fpr": 0.025093207469991694,
55
+ "eval_macro_sensitivity": 0.5148741493607558,
56
+ "eval_macro_specificity": 0.9804978566683986,
57
+ "eval_precision": 0.7158327481302543,
58
+ "eval_precision_macro": 0.4625056436667857,
59
+ "eval_recall": 0.737412858249419,
60
+ "eval_recall_macro": 0.5148741493607558,
61
+ "eval_runtime": 78.3833,
62
+ "eval_samples_per_second": 16.47,
63
+ "eval_steps_per_second": 2.067,
64
+ "eval_weighted_fpr": 0.024804273066510573,
65
+ "eval_weighted_sensitivity": 0.737412858249419,
66
+ "eval_weighted_specificity": 0.9700549917765612,
67
  "step": 1286
68
  },
69
  {
70
  "epoch": 2.33,
71
+ "grad_norm": 16.875791549682617,
72
+ "learning_rate": 4.224468636599274e-05,
73
+ "loss": 0.7714,
74
  "step": 1500
75
  },
76
  {
77
  "epoch": 3.0,
78
+ "eval_accuracy": 0.7621998450813323,
79
+ "eval_f1_macro": 0.5064301619528891,
80
+ "eval_f1_micro": 0.7621998450813323,
81
+ "eval_f1_weighted": 0.7440787580787277,
82
+ "eval_loss": 0.8493772149085999,
83
+ "eval_macro_fpr": 0.022439395825223803,
84
+ "eval_macro_sensitivity": 0.5353612181578932,
85
+ "eval_macro_specificity": 0.9822327546765126,
86
+ "eval_precision": 0.7385639759374297,
87
+ "eval_precision_macro": 0.505572707108006,
88
+ "eval_recall": 0.7621998450813323,
89
+ "eval_recall_macro": 0.5353612181578932,
90
+ "eval_runtime": 62.8149,
91
+ "eval_samples_per_second": 20.552,
92
+ "eval_steps_per_second": 2.579,
93
+ "eval_weighted_fpr": 0.02179933252858056,
94
+ "eval_weighted_sensitivity": 0.7621998450813323,
95
+ "eval_weighted_specificity": 0.9712914750663563,
96
  "step": 1929
97
  },
98
  {
99
  "epoch": 3.11,
100
+ "grad_norm": 59.48842239379883,
101
+ "learning_rate": 3.9652669777086575e-05,
102
+ "loss": 0.7018,
103
  "step": 2000
104
  },
105
  {
106
  "epoch": 3.89,
107
+ "grad_norm": 1.6855363845825195,
108
+ "learning_rate": 3.706583722135822e-05,
109
+ "loss": 0.5351,
110
  "step": 2500
111
  },
112
  {
113
  "epoch": 4.0,
114
+ "eval_accuracy": 0.7645236250968241,
115
+ "eval_f1_macro": 0.544445143585482,
116
+ "eval_f1_micro": 0.7645236250968241,
117
+ "eval_f1_weighted": 0.7545581478665218,
118
+ "eval_loss": 0.9904704093933105,
119
+ "eval_macro_fpr": 0.022368675533492623,
120
+ "eval_macro_sensitivity": 0.5653277909563001,
121
+ "eval_macro_specificity": 0.9821237739107975,
122
+ "eval_precision": 0.7656722240785093,
123
+ "eval_precision_macro": 0.5495765557734748,
124
+ "eval_recall": 0.7645236250968241,
125
+ "eval_recall_macro": 0.5653277909563001,
126
+ "eval_runtime": 80.7211,
127
+ "eval_samples_per_second": 15.993,
128
+ "eval_steps_per_second": 2.007,
129
+ "eval_weighted_fpr": 0.021526695935419914,
130
+ "eval_weighted_sensitivity": 0.7645236250968241,
131
+ "eval_weighted_specificity": 0.9673329835651372,
132
  "step": 2572
133
  },
134
  {
135
  "epoch": 4.67,
136
+ "grad_norm": 41.18514633178711,
137
+ "learning_rate": 3.447382063245205e-05,
138
+ "loss": 0.4521,
139
  "step": 3000
140
  },
141
  {
142
  "epoch": 5.0,
143
+ "eval_accuracy": 0.7900852052672347,
144
+ "eval_f1_macro": 0.6116525431724917,
145
+ "eval_f1_micro": 0.7900852052672347,
146
+ "eval_f1_weighted": 0.7794301250682801,
147
+ "eval_loss": 1.0259578227996826,
148
+ "eval_macro_fpr": 0.019043445988564375,
149
+ "eval_macro_sensitivity": 0.6315170743424566,
150
+ "eval_macro_specificity": 0.984305159354804,
151
+ "eval_precision": 0.7882093327742286,
152
+ "eval_precision_macro": 0.6420940275483907,
153
+ "eval_recall": 0.7900852052672347,
154
+ "eval_recall_macro": 0.6315170743424566,
155
+ "eval_runtime": 56.9964,
156
+ "eval_samples_per_second": 22.651,
157
+ "eval_steps_per_second": 2.842,
158
+ "eval_weighted_fpr": 0.018624149542986735,
159
+ "eval_weighted_sensitivity": 0.7900852052672347,
160
+ "eval_weighted_specificity": 0.9744921850548264,
161
  "step": 3215
162
  },
163
  {
164
  "epoch": 5.44,
165
+ "grad_norm": 92.02596282958984,
166
+ "learning_rate": 3.1881804043545884e-05,
167
+ "loss": 0.3466,
168
  "step": 3500
169
  },
170
  {
171
  "epoch": 6.0,
172
+ "eval_accuracy": 0.7869868319132456,
173
+ "eval_f1_macro": 0.6118575336738351,
174
+ "eval_f1_micro": 0.7869868319132455,
175
+ "eval_f1_weighted": 0.7889880056842663,
176
+ "eval_loss": 1.0384949445724487,
177
+ "eval_macro_fpr": 0.019220806323432427,
178
+ "eval_macro_sensitivity": 0.633518783056355,
179
+ "eval_macro_specificity": 0.984312476194111,
180
+ "eval_precision": 0.8134105657387156,
181
+ "eval_precision_macro": 0.6722188161248251,
182
+ "eval_recall": 0.7869868319132456,
183
+ "eval_recall_macro": 0.633518783056355,
184
+ "eval_runtime": 58.1615,
185
+ "eval_samples_per_second": 22.197,
186
+ "eval_steps_per_second": 2.785,
187
+ "eval_weighted_fpr": 0.018966825298296436,
188
+ "eval_weighted_sensitivity": 0.7869868319132456,
189
+ "eval_weighted_specificity": 0.9777003109984174,
190
  "step": 3858
191
  },
192
  {
193
  "epoch": 6.22,
194
+ "grad_norm": 80.3629379272461,
195
+ "learning_rate": 2.9294971487817523e-05,
196
+ "loss": 0.3321,
197
  "step": 4000
198
  },
199
  {
200
  "epoch": 7.0,
201
+ "grad_norm": 0.3377046585083008,
202
+ "learning_rate": 2.6702954898911353e-05,
203
+ "loss": 0.2333,
204
  "step": 4500
205
  },
206
  {
207
  "epoch": 7.0,
208
+ "eval_accuracy": 0.8117738187451587,
209
+ "eval_f1_macro": 0.665659747836216,
210
+ "eval_f1_micro": 0.8117738187451587,
211
+ "eval_f1_weighted": 0.8057624075524522,
212
+ "eval_loss": 1.1464879512786865,
213
+ "eval_macro_fpr": 0.01693769060060091,
214
+ "eval_macro_sensitivity": 0.6784424177464591,
215
+ "eval_macro_specificity": 0.9857572234742,
216
+ "eval_precision": 0.8064435087918365,
217
+ "eval_precision_macro": 0.6794791733053616,
218
+ "eval_recall": 0.8117738187451587,
219
+ "eval_recall_macro": 0.6784424177464591,
220
+ "eval_runtime": 54.6308,
221
+ "eval_samples_per_second": 23.631,
222
+ "eval_steps_per_second": 2.965,
223
+ "eval_weighted_fpr": 0.016292323164599398,
224
+ "eval_weighted_sensitivity": 0.8117738187451587,
225
+ "eval_weighted_specificity": 0.9745845333678407,
226
  "step": 4501
227
  },
228
  {
229
  "epoch": 7.78,
230
+ "grad_norm": 0.19802448153495789,
231
+ "learning_rate": 2.4110938310005186e-05,
232
+ "loss": 0.1658,
233
  "step": 5000
234
  },
235
  {
236
  "epoch": 8.0,
237
+ "eval_accuracy": 0.814872192099148,
238
+ "eval_f1_macro": 0.7328612504365998,
239
+ "eval_f1_micro": 0.814872192099148,
240
+ "eval_f1_weighted": 0.8120704640541792,
241
+ "eval_loss": 1.241939902305603,
242
+ "eval_macro_fpr": 0.016489901852411035,
243
+ "eval_macro_sensitivity": 0.7440371076362254,
244
+ "eval_macro_specificity": 0.9861286253461167,
245
+ "eval_precision": 0.8148683401292235,
246
+ "eval_precision_macro": 0.7318970148814324,
247
+ "eval_recall": 0.814872192099148,
248
+ "eval_recall_macro": 0.7440371076362254,
249
+ "eval_runtime": 57.719,
250
+ "eval_samples_per_second": 22.367,
251
+ "eval_steps_per_second": 2.807,
252
+ "eval_weighted_fpr": 0.015968463954032203,
253
+ "eval_weighted_sensitivity": 0.814872192099148,
254
+ "eval_weighted_specificity": 0.9770571880926026,
255
  "step": 5144
256
  },
257
  {
258
  "epoch": 8.55,
259
+ "grad_norm": 0.0870741754770279,
260
+ "learning_rate": 2.151892172109902e-05,
261
+ "loss": 0.1597,
262
  "step": 5500
263
  },
264
  {
265
  "epoch": 9.0,
266
+ "eval_accuracy": 0.8179705654531371,
267
+ "eval_f1_macro": 0.7804377723463752,
268
+ "eval_f1_micro": 0.817970565453137,
269
+ "eval_f1_weighted": 0.819003836369197,
270
+ "eval_loss": 1.3440543413162231,
271
+ "eval_macro_fpr": 0.015977205363795557,
272
+ "eval_macro_sensitivity": 0.770217713596195,
273
+ "eval_macro_specificity": 0.9863181364411756,
274
+ "eval_precision": 0.8259393911103454,
275
+ "eval_precision_macro": 0.8314287989687705,
276
+ "eval_recall": 0.8179705654531371,
277
+ "eval_recall_macro": 0.770217713596195,
278
+ "eval_runtime": 90.353,
279
+ "eval_samples_per_second": 14.288,
280
+ "eval_steps_per_second": 1.793,
281
+ "eval_weighted_fpr": 0.01564684732671949,
282
+ "eval_weighted_sensitivity": 0.8179705654531371,
283
+ "eval_weighted_specificity": 0.9768014811644973,
284
  "step": 5787
285
  },
286
  {
287
  "epoch": 9.33,
288
+ "grad_norm": 0.013821585103869438,
289
+ "learning_rate": 1.8926905132192844e-05,
290
+ "loss": 0.11,
291
  "step": 6000
292
  },
293
  {
294
  "epoch": 10.0,
295
+ "eval_accuracy": 0.8024786986831913,
296
+ "eval_f1_macro": 0.7500128517100584,
297
+ "eval_f1_micro": 0.8024786986831914,
298
+ "eval_f1_weighted": 0.8064576225913597,
299
+ "eval_loss": 1.3504691123962402,
300
+ "eval_macro_fpr": 0.01779575845463305,
301
+ "eval_macro_sensitivity": 0.765413440395755,
302
+ "eval_macro_specificity": 0.9852391037313044,
303
+ "eval_precision": 0.8152310151046661,
304
+ "eval_precision_macro": 0.7519799672719661,
305
+ "eval_recall": 0.8024786986831913,
306
+ "eval_recall_macro": 0.765413440395755,
307
+ "eval_runtime": 55.2658,
308
+ "eval_samples_per_second": 23.36,
309
+ "eval_steps_per_second": 2.931,
310
+ "eval_weighted_fpr": 0.017277593332881633,
311
+ "eval_weighted_sensitivity": 0.8024786986831913,
312
+ "eval_weighted_specificity": 0.9761078572863756,
313
  "step": 6430
314
  },
315
  {
316
  "epoch": 10.11,
317
+ "grad_norm": 0.009372069500386715,
318
+ "learning_rate": 1.6334888543286677e-05,
319
+ "loss": 0.0741,
320
  "step": 6500
321
  },
322
  {
323
  "epoch": 10.89,
324
+ "grad_norm": 0.017231620848178864,
325
+ "learning_rate": 1.374805598755832e-05,
326
+ "loss": 0.0747,
327
  "step": 7000
328
  },
329
  {
330
  "epoch": 11.0,
331
+ "eval_accuracy": 0.8280402788536019,
332
+ "eval_f1_macro": 0.7850116201409046,
333
+ "eval_f1_micro": 0.8280402788536019,
334
+ "eval_f1_weighted": 0.8252613057748646,
335
+ "eval_loss": 1.3682292699813843,
336
+ "eval_macro_fpr": 0.015248972295162136,
337
+ "eval_macro_sensitivity": 0.7819796586438489,
338
+ "eval_macro_specificity": 0.9869417363825405,
339
+ "eval_precision": 0.8277410447478016,
340
+ "eval_precision_macro": 0.8096252898700513,
341
+ "eval_recall": 0.8280402788536019,
342
+ "eval_recall_macro": 0.7819796586438489,
343
+ "eval_runtime": 58.5549,
344
+ "eval_samples_per_second": 22.048,
345
+ "eval_steps_per_second": 2.767,
346
+ "eval_weighted_fpr": 0.014616802739004477,
347
+ "eval_weighted_sensitivity": 0.8280402788536019,
348
+ "eval_weighted_specificity": 0.976085766884506,
349
  "step": 7073
350
  },
351
  {
352
  "epoch": 11.66,
353
+ "grad_norm": 0.039045702666044235,
354
+ "learning_rate": 1.1156039398652151e-05,
355
+ "loss": 0.0519,
356
  "step": 7500
357
  },
358
  {
359
  "epoch": 12.0,
360
+ "eval_accuracy": 0.8164213787761425,
361
+ "eval_f1_macro": 0.7698779986816631,
362
+ "eval_f1_micro": 0.8164213787761425,
363
+ "eval_f1_weighted": 0.8170206182613167,
364
+ "eval_loss": 1.4436842203140259,
365
+ "eval_macro_fpr": 0.016423979995821146,
366
+ "eval_macro_sensitivity": 0.7750707038634387,
367
+ "eval_macro_specificity": 0.9861294812620465,
368
+ "eval_precision": 0.8188455079677682,
369
+ "eval_precision_macro": 0.7730875104850559,
370
+ "eval_recall": 0.8164213787761425,
371
+ "eval_recall_macro": 0.7750707038634387,
372
+ "eval_runtime": 56.1974,
373
+ "eval_samples_per_second": 22.973,
374
+ "eval_steps_per_second": 2.883,
375
+ "eval_weighted_fpr": 0.01580737677582872,
376
+ "eval_weighted_sensitivity": 0.8164213787761425,
377
+ "eval_weighted_specificity": 0.9755208401545548,
378
  "step": 7716
379
  },
380
  {
381
  "epoch": 12.44,
382
+ "grad_norm": 220.98574829101562,
383
+ "learning_rate": 8.564022809745984e-06,
384
+ "loss": 0.0324,
385
  "step": 8000
386
  },
387
  {
388
  "epoch": 13.0,
389
+ "eval_accuracy": 0.8086754453911696,
390
+ "eval_f1_macro": 0.7637730945937946,
391
+ "eval_f1_micro": 0.8086754453911695,
392
+ "eval_f1_weighted": 0.8096616104204358,
393
+ "eval_loss": 1.4511244297027588,
394
+ "eval_macro_fpr": 0.017099071788154886,
395
+ "eval_macro_sensitivity": 0.7801835333077355,
396
+ "eval_macro_specificity": 0.9857069816183608,
397
+ "eval_precision": 0.8126700320980054,
398
+ "eval_precision_macro": 0.755164725157429,
399
+ "eval_recall": 0.8086754453911696,
400
+ "eval_recall_macro": 0.7801835333077355,
401
+ "eval_runtime": 62.3649,
402
+ "eval_samples_per_second": 20.701,
403
+ "eval_steps_per_second": 2.598,
404
+ "eval_weighted_fpr": 0.016618448496265894,
405
+ "eval_weighted_sensitivity": 0.8086754453911696,
406
+ "eval_weighted_specificity": 0.9769292788842445,
407
  "step": 8359
408
  },
409
  {
410
  "epoch": 13.22,
411
+ "grad_norm": 0.02690161019563675,
412
+ "learning_rate": 5.9720062208398135e-06,
413
+ "loss": 0.0349,
414
  "step": 8500
415
  },
416
  {
417
  "epoch": 14.0,
418
+ "grad_norm": 0.014679946005344391,
419
+ "learning_rate": 3.379989631933644e-06,
420
+ "loss": 0.0184,
421
  "step": 9000
422
  },
423
  {
424
  "epoch": 14.0,
425
+ "eval_accuracy": 0.8140975987606507,
426
+ "eval_f1_macro": 0.7681382733031227,
427
+ "eval_f1_micro": 0.8140975987606507,
428
+ "eval_f1_weighted": 0.8158709627059858,
429
+ "eval_loss": 1.5005292892456055,
430
+ "eval_macro_fpr": 0.016486730283890944,
431
+ "eval_macro_sensitivity": 0.7847943200142441,
432
+ "eval_macro_specificity": 0.9861151984488189,
433
+ "eval_precision": 0.8196264811835474,
434
+ "eval_precision_macro": 0.7613127212329543,
435
+ "eval_recall": 0.8140975987606507,
436
+ "eval_recall_macro": 0.7847943200142441,
437
+ "eval_runtime": 55.9241,
438
+ "eval_samples_per_second": 23.085,
439
+ "eval_steps_per_second": 2.897,
440
+ "eval_weighted_fpr": 0.016049217600641968,
441
+ "eval_weighted_sensitivity": 0.8140975987606507,
442
+ "eval_weighted_specificity": 0.9776303779716344,
443
  "step": 9002
444
  },
445
  {
446
  "epoch": 14.77,
447
+ "grad_norm": 0.007979592308402061,
448
+ "learning_rate": 7.931570762052877e-07,
449
+ "loss": 0.0137,
450
  "step": 9500
451
  },
452
  {
453
  "epoch": 15.0,
454
+ "eval_accuracy": 0.8164213787761425,
455
+ "eval_f1_macro": 0.7664691580433438,
456
+ "eval_f1_micro": 0.8164213787761425,
457
+ "eval_f1_weighted": 0.8173112279420088,
458
+ "eval_loss": 1.4994738101959229,
459
+ "eval_macro_fpr": 0.01630779929417336,
460
+ "eval_macro_sensitivity": 0.777963226880043,
461
+ "eval_macro_specificity": 0.9862332623102597,
462
+ "eval_precision": 0.8193184364806528,
463
+ "eval_precision_macro": 0.7619970590670772,
464
+ "eval_recall": 0.8164213787761425,
465
+ "eval_recall_macro": 0.777963226880043,
466
+ "eval_runtime": 61.5289,
467
+ "eval_samples_per_second": 20.982,
468
+ "eval_steps_per_second": 2.633,
469
+ "eval_weighted_fpr": 0.01580737677582872,
470
+ "eval_weighted_sensitivity": 0.8164213787761425,
471
+ "eval_weighted_specificity": 0.9770775558777535,
472
  "step": 9645
473
  }
474
  ],
training_checkpoints/checkpoint-9645/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6da235c4e1e89b590bb6c4dd543edc36c67b04a23baad1858c6c64a331ed4bd1
3
  size 4920
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:beb8f128167a5d05587c32e6e3bff806f690d3ab0996792b1d08193bcb3299f2
3
  size 4920