Akash751 commited on
Commit
dd720b9
·
verified ·
1 Parent(s): bd8fc2b

Upload folder using huggingface_hub

Browse files
Files changed (8) hide show
  1. config.json +46 -0
  2. model.safetensors +3 -0
  3. optimizer.pt +3 -0
  4. rng_state.pth +3 -0
  5. scaler.pt +3 -0
  6. scheduler.pt +3 -0
  7. trainer_state.json +368 -0
  8. training_args.bin +3 -0
config.json ADDED
@@ -0,0 +1,46 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_cross_attention": false,
3
+ "architectures": [
4
+ "XLMRobertaForSequenceClassification"
5
+ ],
6
+ "attention_probs_dropout_prob": 0.1,
7
+ "bos_token_id": 0,
8
+ "classifier_dropout": null,
9
+ "dtype": "float32",
10
+ "eos_token_id": 2,
11
+ "hidden_act": "gelu",
12
+ "hidden_dropout_prob": 0.1,
13
+ "hidden_size": 768,
14
+ "id2label": {
15
+ "0": "fear",
16
+ "1": "anger",
17
+ "2": "sadness",
18
+ "3": "disgust",
19
+ "4": "joy",
20
+ "5": "surprise"
21
+ },
22
+ "initializer_range": 0.02,
23
+ "intermediate_size": 3072,
24
+ "is_decoder": false,
25
+ "label2id": {
26
+ "anger": 1,
27
+ "disgust": 3,
28
+ "fear": 0,
29
+ "joy": 4,
30
+ "sadness": 2,
31
+ "surprise": 5
32
+ },
33
+ "layer_norm_eps": 1e-05,
34
+ "max_position_embeddings": 514,
35
+ "model_type": "xlm-roberta",
36
+ "num_attention_heads": 12,
37
+ "num_hidden_layers": 12,
38
+ "output_past": true,
39
+ "pad_token_id": 1,
40
+ "position_embedding_type": "absolute",
41
+ "tie_word_embeddings": true,
42
+ "transformers_version": "5.10.1",
43
+ "type_vocab_size": 1,
44
+ "use_cache": false,
45
+ "vocab_size": 250002
46
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b8fd230e365c0fbbae1ddaf749b2b0655ac5b29f503a5f2d1960d46cd32ea3c8
3
+ size 1112217312
optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2edef80e169f724aa06e88928dc3f1254c8f1c8122caa1c31e5a25a9cb548453
3
+ size 2224557451
rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6aac33d382868a168809d2c3ac8c7efb276c1f597e376a9a61c2cba28881592a
3
+ size 14645
scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:040c31ecf895d199328434c37d5d66f5b653c781b0d4d25db730ae83754eeceb
3
+ size 1383
scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f7b2c5db660e6409b97c61c496365a053bb14ef6692f6a348b697690d68ec5fd
3
+ size 1465
trainer_state.json ADDED
@@ -0,0 +1,368 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 20025,
3
+ "best_metric": 0.6554931335830212,
4
+ "best_model_checkpoint": "/content/drive/MyDrive/final/roberta_emotion_model/checkpoint-20025",
5
+ "epoch": 5.0,
6
+ "eval_steps": 500,
7
+ "global_step": 20025,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.12484394506866417,
14
+ "grad_norm": 48.22937774658203,
15
+ "learning_rate": 9.750811485642947e-06,
16
+ "loss": 3.1020751953125,
17
+ "step": 500
18
+ },
19
+ {
20
+ "epoch": 0.24968789013732834,
21
+ "grad_norm": 28.517393112182617,
22
+ "learning_rate": 9.50112359550562e-06,
23
+ "loss": 2.5971416015625,
24
+ "step": 1000
25
+ },
26
+ {
27
+ "epoch": 0.37453183520599254,
28
+ "grad_norm": 45.27549743652344,
29
+ "learning_rate": 9.25143570536829e-06,
30
+ "loss": 2.350372802734375,
31
+ "step": 1500
32
+ },
33
+ {
34
+ "epoch": 0.4993757802746567,
35
+ "grad_norm": 63.087188720703125,
36
+ "learning_rate": 9.001747815230962e-06,
37
+ "loss": 2.30302587890625,
38
+ "step": 2000
39
+ },
40
+ {
41
+ "epoch": 0.6242197253433208,
42
+ "grad_norm": 68.39694213867188,
43
+ "learning_rate": 8.752059925093633e-06,
44
+ "loss": 2.235894287109375,
45
+ "step": 2500
46
+ },
47
+ {
48
+ "epoch": 0.7490636704119851,
49
+ "grad_norm": 48.36997985839844,
50
+ "learning_rate": 8.502372034956306e-06,
51
+ "loss": 2.18744384765625,
52
+ "step": 3000
53
+ },
54
+ {
55
+ "epoch": 0.8739076154806492,
56
+ "grad_norm": 63.88243865966797,
57
+ "learning_rate": 8.252684144818976e-06,
58
+ "loss": 2.1574775390625,
59
+ "step": 3500
60
+ },
61
+ {
62
+ "epoch": 0.9987515605493134,
63
+ "grad_norm": 25.953285217285156,
64
+ "learning_rate": 8.002996254681649e-06,
65
+ "loss": 2.149793701171875,
66
+ "step": 4000
67
+ },
68
+ {
69
+ "epoch": 1.0,
70
+ "eval_accuracy": 0.5983770287141074,
71
+ "eval_loss": 1.0222212076187134,
72
+ "eval_runtime": 31.588,
73
+ "eval_samples_per_second": 507.154,
74
+ "eval_steps_per_second": 31.721,
75
+ "step": 4005
76
+ },
77
+ {
78
+ "epoch": 1.1235955056179776,
79
+ "grad_norm": 65.45611572265625,
80
+ "learning_rate": 7.753308364544321e-06,
81
+ "loss": 1.9485059814453125,
82
+ "step": 4500
83
+ },
84
+ {
85
+ "epoch": 1.2484394506866416,
86
+ "grad_norm": 79.43843078613281,
87
+ "learning_rate": 7.503620474406992e-06,
88
+ "loss": 1.950569580078125,
89
+ "step": 5000
90
+ },
91
+ {
92
+ "epoch": 1.373283395755306,
93
+ "grad_norm": 38.40707015991211,
94
+ "learning_rate": 7.253932584269664e-06,
95
+ "loss": 1.957847900390625,
96
+ "step": 5500
97
+ },
98
+ {
99
+ "epoch": 1.4981273408239701,
100
+ "grad_norm": 29.66714096069336,
101
+ "learning_rate": 7.004244694132335e-06,
102
+ "loss": 1.90708447265625,
103
+ "step": 6000
104
+ },
105
+ {
106
+ "epoch": 1.6229712858926342,
107
+ "grad_norm": 28.491024017333984,
108
+ "learning_rate": 6.754556803995007e-06,
109
+ "loss": 1.911080078125,
110
+ "step": 6500
111
+ },
112
+ {
113
+ "epoch": 1.7478152309612984,
114
+ "grad_norm": 94.18211364746094,
115
+ "learning_rate": 6.504868913857678e-06,
116
+ "loss": 1.8992110595703124,
117
+ "step": 7000
118
+ },
119
+ {
120
+ "epoch": 1.8726591760299627,
121
+ "grad_norm": 28.84901237487793,
122
+ "learning_rate": 6.25518102372035e-06,
123
+ "loss": 1.887749755859375,
124
+ "step": 7500
125
+ },
126
+ {
127
+ "epoch": 1.9975031210986267,
128
+ "grad_norm": 51.08824920654297,
129
+ "learning_rate": 6.005493133583021e-06,
130
+ "loss": 1.891501220703125,
131
+ "step": 8000
132
+ },
133
+ {
134
+ "epoch": 2.0,
135
+ "eval_accuracy": 0.6292759051186018,
136
+ "eval_loss": 0.942175567150116,
137
+ "eval_runtime": 31.7611,
138
+ "eval_samples_per_second": 504.391,
139
+ "eval_steps_per_second": 31.548,
140
+ "step": 8010
141
+ },
142
+ {
143
+ "epoch": 2.1223470661672907,
144
+ "grad_norm": 41.6335563659668,
145
+ "learning_rate": 5.755805243445693e-06,
146
+ "loss": 1.7376878662109374,
147
+ "step": 8500
148
+ },
149
+ {
150
+ "epoch": 2.247191011235955,
151
+ "grad_norm": 54.421661376953125,
152
+ "learning_rate": 5.506117353308364e-06,
153
+ "loss": 1.723041748046875,
154
+ "step": 9000
155
+ },
156
+ {
157
+ "epoch": 2.3720349563046192,
158
+ "grad_norm": 39.90679168701172,
159
+ "learning_rate": 5.256429463171036e-06,
160
+ "loss": 1.71384814453125,
161
+ "step": 9500
162
+ },
163
+ {
164
+ "epoch": 2.4968789013732833,
165
+ "grad_norm": 35.013450622558594,
166
+ "learning_rate": 5.006741573033709e-06,
167
+ "loss": 1.6872838134765624,
168
+ "step": 10000
169
+ },
170
+ {
171
+ "epoch": 2.6217228464419478,
172
+ "grad_norm": 26.661258697509766,
173
+ "learning_rate": 4.7570536828963795e-06,
174
+ "loss": 1.6985811767578125,
175
+ "step": 10500
176
+ },
177
+ {
178
+ "epoch": 2.746566791510612,
179
+ "grad_norm": 30.96997833251953,
180
+ "learning_rate": 4.5073657927590515e-06,
181
+ "loss": 1.66519970703125,
182
+ "step": 11000
183
+ },
184
+ {
185
+ "epoch": 2.871410736579276,
186
+ "grad_norm": 32.575050354003906,
187
+ "learning_rate": 4.257677902621723e-06,
188
+ "loss": 1.6637918701171874,
189
+ "step": 11500
190
+ },
191
+ {
192
+ "epoch": 2.9962546816479403,
193
+ "grad_norm": 44.792823791503906,
194
+ "learning_rate": 4.007990012484395e-06,
195
+ "loss": 1.6791025390625,
196
+ "step": 12000
197
+ },
198
+ {
199
+ "epoch": 3.0,
200
+ "eval_accuracy": 0.6441323345817728,
201
+ "eval_loss": 0.9494165182113647,
202
+ "eval_runtime": 31.7182,
203
+ "eval_samples_per_second": 505.072,
204
+ "eval_steps_per_second": 31.591,
205
+ "step": 12015
206
+ },
207
+ {
208
+ "epoch": 3.1210986267166043,
209
+ "grad_norm": 66.56997680664062,
210
+ "learning_rate": 3.7583021223470666e-06,
211
+ "loss": 1.5335745849609375,
212
+ "step": 12500
213
+ },
214
+ {
215
+ "epoch": 3.2459425717852683,
216
+ "grad_norm": 63.02039337158203,
217
+ "learning_rate": 3.508614232209738e-06,
218
+ "loss": 1.51216015625,
219
+ "step": 13000
220
+ },
221
+ {
222
+ "epoch": 3.370786516853933,
223
+ "grad_norm": 60.7429313659668,
224
+ "learning_rate": 3.2589263420724098e-06,
225
+ "loss": 1.5589078369140625,
226
+ "step": 13500
227
+ },
228
+ {
229
+ "epoch": 3.495630461922597,
230
+ "grad_norm": 33.59284210205078,
231
+ "learning_rate": 3.0092384519350813e-06,
232
+ "loss": 1.554709228515625,
233
+ "step": 14000
234
+ },
235
+ {
236
+ "epoch": 3.620474406991261,
237
+ "grad_norm": 83.69245910644531,
238
+ "learning_rate": 2.759550561797753e-06,
239
+ "loss": 1.49451025390625,
240
+ "step": 14500
241
+ },
242
+ {
243
+ "epoch": 3.7453183520599254,
244
+ "grad_norm": 58.14004898071289,
245
+ "learning_rate": 2.5098626716604245e-06,
246
+ "loss": 1.511951904296875,
247
+ "step": 15000
248
+ },
249
+ {
250
+ "epoch": 3.8701622971285894,
251
+ "grad_norm": 47.35211944580078,
252
+ "learning_rate": 2.260174781523096e-06,
253
+ "loss": 1.5268017578125,
254
+ "step": 15500
255
+ },
256
+ {
257
+ "epoch": 3.9950062421972534,
258
+ "grad_norm": 64.91954040527344,
259
+ "learning_rate": 2.010486891385768e-06,
260
+ "loss": 1.512477294921875,
261
+ "step": 16000
262
+ },
263
+ {
264
+ "epoch": 4.0,
265
+ "eval_accuracy": 0.6526841448189763,
266
+ "eval_loss": 0.9551559090614319,
267
+ "eval_runtime": 31.4775,
268
+ "eval_samples_per_second": 508.935,
269
+ "eval_steps_per_second": 31.832,
270
+ "step": 16020
271
+ },
272
+ {
273
+ "epoch": 4.119850187265918,
274
+ "grad_norm": 54.49357604980469,
275
+ "learning_rate": 1.7607990012484397e-06,
276
+ "loss": 1.39636083984375,
277
+ "step": 16500
278
+ },
279
+ {
280
+ "epoch": 4.2446941323345815,
281
+ "grad_norm": 91.57239532470703,
282
+ "learning_rate": 1.5111111111111112e-06,
283
+ "loss": 1.3841357421875,
284
+ "step": 17000
285
+ },
286
+ {
287
+ "epoch": 4.369538077403246,
288
+ "grad_norm": 103.39310455322266,
289
+ "learning_rate": 1.2614232209737828e-06,
290
+ "loss": 1.3866033935546875,
291
+ "step": 17500
292
+ },
293
+ {
294
+ "epoch": 4.49438202247191,
295
+ "grad_norm": 68.51345825195312,
296
+ "learning_rate": 1.0117353308364546e-06,
297
+ "loss": 1.3865987548828125,
298
+ "step": 18000
299
+ },
300
+ {
301
+ "epoch": 4.619225967540574,
302
+ "grad_norm": 61.58140563964844,
303
+ "learning_rate": 7.620474406991262e-07,
304
+ "loss": 1.413747802734375,
305
+ "step": 18500
306
+ },
307
+ {
308
+ "epoch": 4.7440699126092385,
309
+ "grad_norm": 24.058151245117188,
310
+ "learning_rate": 5.123595505617978e-07,
311
+ "loss": 1.393927978515625,
312
+ "step": 19000
313
+ },
314
+ {
315
+ "epoch": 4.868913857677903,
316
+ "grad_norm": 39.903724670410156,
317
+ "learning_rate": 2.6267166042446943e-07,
318
+ "loss": 1.436919677734375,
319
+ "step": 19500
320
+ },
321
+ {
322
+ "epoch": 4.9937578027465666,
323
+ "grad_norm": 59.79766845703125,
324
+ "learning_rate": 1.2983770287141074e-08,
325
+ "loss": 1.3762628173828124,
326
+ "step": 20000
327
+ },
328
+ {
329
+ "epoch": 5.0,
330
+ "eval_accuracy": 0.6554931335830212,
331
+ "eval_loss": 0.9726009964942932,
332
+ "eval_runtime": 31.4744,
333
+ "eval_samples_per_second": 508.985,
334
+ "eval_steps_per_second": 31.835,
335
+ "step": 20025
336
+ }
337
+ ],
338
+ "logging_steps": 500,
339
+ "max_steps": 20025,
340
+ "num_input_tokens_seen": 0,
341
+ "num_train_epochs": 5,
342
+ "save_steps": 500,
343
+ "stateful_callbacks": {
344
+ "EarlyStoppingCallback": {
345
+ "args": {
346
+ "early_stopping_patience": 2,
347
+ "early_stopping_threshold": 0.0
348
+ },
349
+ "attributes": {
350
+ "early_stopping_patience_counter": 0
351
+ }
352
+ },
353
+ "TrainerControl": {
354
+ "args": {
355
+ "should_epoch_stop": false,
356
+ "should_evaluate": false,
357
+ "should_log": false,
358
+ "should_save": true,
359
+ "should_training_stop": true
360
+ },
361
+ "attributes": {}
362
+ }
363
+ },
364
+ "total_flos": 2.107529463578112e+16,
365
+ "train_batch_size": 8,
366
+ "trial_name": null,
367
+ "trial_params": null
368
+ }
training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fe091723f23ed1c5f6ce73d481555956a4931eefeb0b0b1c41e198e36a79d15c
3
+ size 5201