matiashoyl commited on
Commit
b88cab9
·
verified ·
1 Parent(s): d42e682

Training in progress, epoch 7

Browse files
all_results.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 6.0,
3
+ "test_accuracy": 0.4205607476635514,
4
+ "test_f1": 0.3758792694421824,
5
+ "test_f1_class_0": 0.5405405405405406,
6
+ "test_f1_class_1": 0.09090909090909091,
7
+ "test_f1_class_2": 0.1,
8
+ "test_f1_class_3": 0.21052631578947367,
9
+ "test_f1_class_4": 0.5979381443298969,
10
+ "test_loss": 1.3978204727172852,
11
+ "test_precision": 0.37640186915887847,
12
+ "test_recall": 0.4205607476635514,
13
+ "test_runtime": 5.415,
14
+ "test_samples_per_second": 19.76,
15
+ "test_steps_per_second": 4.986,
16
+ "total_flos": 873039758653440.0,
17
+ "train_loss": 1.1469601062228003,
18
+ "train_runtime": 498.0507,
19
+ "train_samples_per_second": 8.573,
20
+ "train_steps_per_second": 2.148
21
+ }
confusion_matrix.png ADDED
logs/events.out.tfevents.1740978511.mac.lan.55690.79 ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5f5aa64134ce6e1805f763e5513d5887aab92a4764784f5d3e882e293c8af8b7
3
+ size 830
logs/events.out.tfevents.1741012110.mac.lan.55690.100 ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7d44f357d7b7a5d8b33f525d2c718ceef7018660d37b2a56bc32a2b8178801b0
3
+ size 7807
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b5ca9c6b0fa8eff9fff7e88e283aaa0c2f9287565f01dd59c690575d2a2eb2f0
3
  size 598449012
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1afa1babf84f54ac357610bb13f7de51551aee7d830ea84dd7f41924ced93373
3
  size 598449012
test_results.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 6.0,
3
+ "test_accuracy": 0.4205607476635514,
4
+ "test_f1": 0.3758792694421824,
5
+ "test_f1_class_0": 0.5405405405405406,
6
+ "test_f1_class_1": 0.09090909090909091,
7
+ "test_f1_class_2": 0.1,
8
+ "test_f1_class_3": 0.21052631578947367,
9
+ "test_f1_class_4": 0.5979381443298969,
10
+ "test_loss": 1.3978204727172852,
11
+ "test_precision": 0.37640186915887847,
12
+ "test_recall": 0.4205607476635514,
13
+ "test_runtime": 5.415,
14
+ "test_samples_per_second": 19.76,
15
+ "test_steps_per_second": 4.986
16
+ }
train_results.json ADDED
@@ -0,0 +1,8 @@
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 6.0,
3
+ "total_flos": 873039758653440.0,
4
+ "train_loss": 1.1469601062228003,
5
+ "train_runtime": 498.0507,
6
+ "train_samples_per_second": 8.573,
7
+ "train_steps_per_second": 2.148
8
+ }
trainer_state.json ADDED
@@ -0,0 +1,363 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": 1.3978204727172852,
3
+ "best_model_checkpoint": "user_models/user_50149/checkpoint-321",
4
+ "epoch": 6.0,
5
+ "eval_steps": 500,
6
+ "global_step": 642,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.19626168224299065,
13
+ "grad_norm": 18.907575607299805,
14
+ "learning_rate": 3.925233644859814e-06,
15
+ "loss": 1.6416,
16
+ "step": 21
17
+ },
18
+ {
19
+ "epoch": 0.3925233644859813,
20
+ "grad_norm": 18.843624114990234,
21
+ "learning_rate": 7.850467289719627e-06,
22
+ "loss": 1.6233,
23
+ "step": 42
24
+ },
25
+ {
26
+ "epoch": 0.5887850467289719,
27
+ "grad_norm": 10.201820373535156,
28
+ "learning_rate": 1.177570093457944e-05,
29
+ "loss": 1.6652,
30
+ "step": 63
31
+ },
32
+ {
33
+ "epoch": 0.7850467289719626,
34
+ "grad_norm": 12.853364944458008,
35
+ "learning_rate": 1.5700934579439254e-05,
36
+ "loss": 1.582,
37
+ "step": 84
38
+ },
39
+ {
40
+ "epoch": 0.9813084112149533,
41
+ "grad_norm": 14.50940227508545,
42
+ "learning_rate": 1.9626168224299065e-05,
43
+ "loss": 1.6005,
44
+ "step": 105
45
+ },
46
+ {
47
+ "epoch": 1.0,
48
+ "eval_accuracy": 0.3177570093457944,
49
+ "eval_f1": 0.2863669085995949,
50
+ "eval_f1_class_0": 0.41935483870967744,
51
+ "eval_f1_class_1": 0.21052631578947367,
52
+ "eval_f1_class_2": 0.14285714285714285,
53
+ "eval_f1_class_3": 0.0,
54
+ "eval_f1_class_4": 0.4411764705882353,
55
+ "eval_loss": 1.538644790649414,
56
+ "eval_precision": 0.2783041645663615,
57
+ "eval_recall": 0.3177570093457944,
58
+ "eval_runtime": 5.1789,
59
+ "eval_samples_per_second": 20.661,
60
+ "eval_steps_per_second": 5.213,
61
+ "step": 107
62
+ },
63
+ {
64
+ "epoch": 1.1775700934579438,
65
+ "grad_norm": 8.494335174560547,
66
+ "learning_rate": 1.998079628167323e-05,
67
+ "loss": 1.4077,
68
+ "step": 126
69
+ },
70
+ {
71
+ "epoch": 1.3738317757009346,
72
+ "grad_norm": 11.252021789550781,
73
+ "learning_rate": 1.9914980058500016e-05,
74
+ "loss": 1.6239,
75
+ "step": 147
76
+ },
77
+ {
78
+ "epoch": 1.5700934579439252,
79
+ "grad_norm": 11.045428276062012,
80
+ "learning_rate": 1.9802647259292876e-05,
81
+ "loss": 1.5567,
82
+ "step": 168
83
+ },
84
+ {
85
+ "epoch": 1.7663551401869158,
86
+ "grad_norm": 7.688369274139404,
87
+ "learning_rate": 1.9644324898444645e-05,
88
+ "loss": 1.3852,
89
+ "step": 189
90
+ },
91
+ {
92
+ "epoch": 1.9626168224299065,
93
+ "grad_norm": 7.697967529296875,
94
+ "learning_rate": 1.9440755752450364e-05,
95
+ "loss": 1.5645,
96
+ "step": 210
97
+ },
98
+ {
99
+ "epoch": 2.0,
100
+ "eval_accuracy": 0.411214953271028,
101
+ "eval_f1": 0.29006813896052763,
102
+ "eval_f1_class_0": 0.4878048780487805,
103
+ "eval_f1_class_1": 0.0,
104
+ "eval_f1_class_2": 0.0,
105
+ "eval_f1_class_3": 0.0,
106
+ "eval_f1_class_4": 0.5619834710743802,
107
+ "eval_loss": 1.4633408784866333,
108
+ "eval_precision": 0.23809523809523808,
109
+ "eval_recall": 0.411214953271028,
110
+ "eval_runtime": 5.2459,
111
+ "eval_samples_per_second": 20.397,
112
+ "eval_steps_per_second": 5.147,
113
+ "step": 214
114
+ },
115
+ {
116
+ "epoch": 2.1588785046728973,
117
+ "grad_norm": 7.654632091522217,
118
+ "learning_rate": 1.9192894875137864e-05,
119
+ "loss": 1.3278,
120
+ "step": 231
121
+ },
122
+ {
123
+ "epoch": 2.3551401869158877,
124
+ "grad_norm": 12.362059593200684,
125
+ "learning_rate": 1.8901905116989687e-05,
126
+ "loss": 1.386,
127
+ "step": 252
128
+ },
129
+ {
130
+ "epoch": 2.5514018691588785,
131
+ "grad_norm": 14.643189430236816,
132
+ "learning_rate": 1.8569151669577584e-05,
133
+ "loss": 1.1659,
134
+ "step": 273
135
+ },
136
+ {
137
+ "epoch": 2.7476635514018692,
138
+ "grad_norm": 12.226801872253418,
139
+ "learning_rate": 1.8196195660704713e-05,
140
+ "loss": 1.3803,
141
+ "step": 294
142
+ },
143
+ {
144
+ "epoch": 2.94392523364486,
145
+ "grad_norm": 10.002374649047852,
146
+ "learning_rate": 1.7784786830304163e-05,
147
+ "loss": 1.4339,
148
+ "step": 315
149
+ },
150
+ {
151
+ "epoch": 3.0,
152
+ "eval_accuracy": 0.4205607476635514,
153
+ "eval_f1": 0.3758792694421824,
154
+ "eval_f1_class_0": 0.5405405405405406,
155
+ "eval_f1_class_1": 0.09090909090909091,
156
+ "eval_f1_class_2": 0.1,
157
+ "eval_f1_class_3": 0.21052631578947367,
158
+ "eval_f1_class_4": 0.5979381443298969,
159
+ "eval_loss": 1.3978204727172852,
160
+ "eval_precision": 0.37640186915887847,
161
+ "eval_recall": 0.4205607476635514,
162
+ "eval_runtime": 5.2114,
163
+ "eval_samples_per_second": 20.532,
164
+ "eval_steps_per_second": 5.181,
165
+ "step": 321
166
+ },
167
+ {
168
+ "epoch": 3.1401869158878504,
169
+ "grad_norm": 10.777024269104004,
170
+ "learning_rate": 1.7336855321455126e-05,
171
+ "loss": 1.0956,
172
+ "step": 336
173
+ },
174
+ {
175
+ "epoch": 3.336448598130841,
176
+ "grad_norm": 36.37456512451172,
177
+ "learning_rate": 1.6854502625029642e-05,
178
+ "loss": 1.0556,
179
+ "step": 357
180
+ },
181
+ {
182
+ "epoch": 3.5327102803738315,
183
+ "grad_norm": 12.113136291503906,
184
+ "learning_rate": 1.6339991720453395e-05,
185
+ "loss": 0.9665,
186
+ "step": 378
187
+ },
188
+ {
189
+ "epoch": 3.7289719626168223,
190
+ "grad_norm": 24.207178115844727,
191
+ "learning_rate": 1.5795736458835698e-05,
192
+ "loss": 0.9452,
193
+ "step": 399
194
+ },
195
+ {
196
+ "epoch": 3.925233644859813,
197
+ "grad_norm": 11.722213745117188,
198
+ "learning_rate": 1.5224290238278161e-05,
199
+ "loss": 1.0045,
200
+ "step": 420
201
+ },
202
+ {
203
+ "epoch": 4.0,
204
+ "eval_accuracy": 0.3644859813084112,
205
+ "eval_f1": 0.3516195372033098,
206
+ "eval_f1_class_0": 0.42424242424242425,
207
+ "eval_f1_class_1": 0.3137254901960784,
208
+ "eval_f1_class_2": 0.2926829268292683,
209
+ "eval_f1_class_3": 0.0,
210
+ "eval_f1_class_4": 0.5217391304347826,
211
+ "eval_loss": 1.707943320274353,
212
+ "eval_precision": 0.3755250590530964,
213
+ "eval_recall": 0.3644859813084112,
214
+ "eval_runtime": 5.2821,
215
+ "eval_samples_per_second": 20.257,
216
+ "eval_steps_per_second": 5.112,
217
+ "step": 428
218
+ },
219
+ {
220
+ "epoch": 4.121495327102804,
221
+ "grad_norm": 12.007721900939941,
222
+ "learning_rate": 1.4628334024492366e-05,
223
+ "loss": 0.9364,
224
+ "step": 441
225
+ },
226
+ {
227
+ "epoch": 4.317757009345795,
228
+ "grad_norm": 15.63640022277832,
229
+ "learning_rate": 1.4010663772928339e-05,
230
+ "loss": 0.8197,
231
+ "step": 462
232
+ },
233
+ {
234
+ "epoch": 4.5140186915887845,
235
+ "grad_norm": 48.92936706542969,
236
+ "learning_rate": 1.3374177311423481e-05,
237
+ "loss": 0.6792,
238
+ "step": 483
239
+ },
240
+ {
241
+ "epoch": 4.710280373831775,
242
+ "grad_norm": 13.728958129882812,
243
+ "learning_rate": 1.2721860744912588e-05,
244
+ "loss": 1.0839,
245
+ "step": 504
246
+ },
247
+ {
248
+ "epoch": 4.906542056074766,
249
+ "grad_norm": 30.606203079223633,
250
+ "learning_rate": 1.2056774445981922e-05,
251
+ "loss": 0.6207,
252
+ "step": 525
253
+ },
254
+ {
255
+ "epoch": 5.0,
256
+ "eval_accuracy": 0.40186915887850466,
257
+ "eval_f1": 0.40351674467827703,
258
+ "eval_f1_class_0": 0.5454545454545454,
259
+ "eval_f1_class_1": 0.09523809523809523,
260
+ "eval_f1_class_2": 0.37209302325581395,
261
+ "eval_f1_class_3": 0.2857142857142857,
262
+ "eval_f1_class_4": 0.5263157894736842,
263
+ "eval_loss": 2.141951084136963,
264
+ "eval_precision": 0.46968927246613995,
265
+ "eval_recall": 0.40186915887850466,
266
+ "eval_runtime": 5.2359,
267
+ "eval_samples_per_second": 20.436,
268
+ "eval_steps_per_second": 5.157,
269
+ "step": 535
270
+ },
271
+ {
272
+ "epoch": 5.102803738317757,
273
+ "grad_norm": 3.1776702404022217,
274
+ "learning_rate": 1.1382038696993195e-05,
275
+ "loss": 0.6466,
276
+ "step": 546
277
+ },
278
+ {
279
+ "epoch": 5.299065420560748,
280
+ "grad_norm": 5.055131912231445,
281
+ "learning_rate": 1.0700819051138189e-05,
282
+ "loss": 0.4934,
283
+ "step": 567
284
+ },
285
+ {
286
+ "epoch": 5.4953271028037385,
287
+ "grad_norm": 18.38237190246582,
288
+ "learning_rate": 1.0016311481103214e-05,
289
+ "loss": 0.705,
290
+ "step": 588
291
+ },
292
+ {
293
+ "epoch": 5.691588785046729,
294
+ "grad_norm": 54.925758361816406,
295
+ "learning_rate": 9.331727385019119e-06,
296
+ "loss": 0.5271,
297
+ "step": 609
298
+ },
299
+ {
300
+ "epoch": 5.88785046728972,
301
+ "grad_norm": 18.593154907226562,
302
+ "learning_rate": 8.650278520042169e-06,
303
+ "loss": 0.7996,
304
+ "step": 630
305
+ },
306
+ {
307
+ "epoch": 6.0,
308
+ "eval_accuracy": 0.411214953271028,
309
+ "eval_f1": 0.4151496271122439,
310
+ "eval_f1_class_0": 0.47619047619047616,
311
+ "eval_f1_class_1": 0.32,
312
+ "eval_f1_class_2": 0.37037037037037035,
313
+ "eval_f1_class_3": 0.2727272727272727,
314
+ "eval_f1_class_4": 0.509090909090909,
315
+ "eval_loss": 2.4410297870635986,
316
+ "eval_precision": 0.5027358415208882,
317
+ "eval_recall": 0.411214953271028,
318
+ "eval_runtime": 5.2882,
319
+ "eval_samples_per_second": 20.234,
320
+ "eval_steps_per_second": 5.106,
321
+ "step": 642
322
+ },
323
+ {
324
+ "epoch": 6.0,
325
+ "step": 642,
326
+ "total_flos": 873039758653440.0,
327
+ "train_loss": 1.1469601062228003,
328
+ "train_runtime": 498.0507,
329
+ "train_samples_per_second": 8.573,
330
+ "train_steps_per_second": 2.148
331
+ }
332
+ ],
333
+ "logging_steps": 21,
334
+ "max_steps": 1070,
335
+ "num_input_tokens_seen": 0,
336
+ "num_train_epochs": 10,
337
+ "save_steps": 500,
338
+ "stateful_callbacks": {
339
+ "EarlyStoppingCallback": {
340
+ "args": {
341
+ "early_stopping_patience": 3,
342
+ "early_stopping_threshold": 0.02
343
+ },
344
+ "attributes": {
345
+ "early_stopping_patience_counter": 3
346
+ }
347
+ },
348
+ "TrainerControl": {
349
+ "args": {
350
+ "should_epoch_stop": false,
351
+ "should_evaluate": false,
352
+ "should_log": false,
353
+ "should_save": true,
354
+ "should_training_stop": true
355
+ },
356
+ "attributes": {}
357
+ }
358
+ },
359
+ "total_flos": 873039758653440.0,
360
+ "train_batch_size": 4,
361
+ "trial_name": null,
362
+ "trial_params": null
363
+ }