palaciodata commited on
Commit
f1fe7af
·
verified ·
1 Parent(s): 6b92d8d

Upload: model.onnx <- model.safetensors

Browse files
Files changed (6) hide show
  1. config.json +11 -77
  2. model.onnx +3 -0
  3. optimizer.pt +3 -0
  4. rng_state.pth +3 -0
  5. scheduler.pt +3 -0
  6. trainer_state.json +311 -0
config.json CHANGED
@@ -1,91 +1,25 @@
1
  {
 
2
  "architectures": [
3
  "BertDualHeadModel"
4
  ],
5
- "attention_bias": false,
6
- "attention_dropout": 0.0,
7
- "bos_token_id": 3,
8
- "classifier_activation": "silu",
9
- "classifier_bias": false,
10
- "classifier_dropout": 0.0,
11
- "classifier_pooling": "mean",
12
- "cls_token_id": 50281,
13
- "decoder_bias": true,
14
- "deterministic_flash_attn": false,
15
- "dtype": "float32",
16
- "embedding_dropout": 0.0,
17
- "eos_token_id": 4,
18
- "global_attn_every_n_layers": 3,
19
- "gradient_checkpointing": false,
20
- "hidden_activation": "gelu",
21
- "hidden_size": 768,
22
  "id2label": {
23
  "0": "NONE",
24
  "1": "ENTAILMENT"
25
  },
26
- "initializer_cutoff_factor": 2.0,
27
- "initializer_range": 0.02,
28
- "intermediate_size": 1152,
29
  "label2id": {
30
- "ENTAILMENT": 1,
31
- "NONE": 0
32
- },
33
- "layer_norm_eps": 1e-05,
34
- "layer_types": [
35
- "full_attention",
36
- "sliding_attention",
37
- "sliding_attention",
38
- "full_attention",
39
- "sliding_attention",
40
- "sliding_attention",
41
- "full_attention",
42
- "sliding_attention",
43
- "sliding_attention",
44
- "full_attention",
45
- "sliding_attention",
46
- "sliding_attention",
47
- "full_attention",
48
- "sliding_attention",
49
- "sliding_attention",
50
- "full_attention",
51
- "sliding_attention",
52
- "sliding_attention",
53
- "full_attention",
54
- "sliding_attention",
55
- "sliding_attention",
56
- "full_attention"
57
- ],
58
- "local_attention": 128,
59
- "max_position_embeddings": 8192,
60
- "mlp_bias": false,
61
- "mlp_dropout": 0.0,
62
- "model_type": "modernbert",
63
- "norm_bias": false,
64
- "norm_eps": 1e-05,
65
- "num_attention_heads": 12,
66
- "num_hidden_layers": 22,
67
- "pad_token_id": 5,
68
- "position_embedding_type": "absolute",
69
- "repad_logits_with_grad": false,
70
- "rope_parameters": {
71
- "full_attention": {
72
- "rope_theta": 160000.0,
73
- "rope_type": "default"
74
- },
75
- "sliding_attention": {
76
- "rope_theta": 10000.0,
77
- "rope_type": "default"
78
- }
79
  },
80
- "sep_token_id": 50282,
81
- "sparse_pred_ignore_index": -100,
82
- "sparse_prediction": false,
83
- "task": "nli-multitask",
84
  "tasks": [
85
  "text-classification",
86
  "similarity-regression"
87
  ],
88
- "tie_word_embeddings": true,
89
- "transformers_version": "5.0.0",
90
- "vocab_size": 50368
91
- }
 
1
  {
2
+ "model_type": "bert",
3
  "architectures": [
4
  "BertDualHeadModel"
5
  ],
6
+ "onnx_file": "model.onnx",
7
+ "model_format": "onnx",
8
+ "base_model": "Itau-Unibanco/NorBERTo-base",
9
+ "num_labels": 2,
 
 
 
 
 
 
 
 
 
 
 
 
 
10
  "id2label": {
11
  "0": "NONE",
12
  "1": "ENTAILMENT"
13
  },
 
 
 
14
  "label2id": {
15
+ "NONE": 0,
16
+ "ENTAILMENT": 1
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
17
  },
 
 
 
 
18
  "tasks": [
19
  "text-classification",
20
  "similarity-regression"
21
  ],
22
+ "hidden_size": 768,
23
+ "vocab_size": 50265,
24
+ "max_position_embeddings": 512
25
+ }
model.onnx ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a131c8f663ba9bca7f73496ba9d80dde5f8b6c3279720a1967509893f9600cac
3
+ size 608422621
optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:026bdc7c6be548208162034d7f13016dda0ccf4aa79222902e3d1fa5f557afff
3
+ size 1215859851
rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2c12e79b9e5dc02c2f4a016b1026f5987487dac8577eddac271f1a988a197d88
3
+ size 14645
scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:defb0eccaec2bd9af1b529c7d9102bc08561dd7771db695d99253463a8577212
3
+ size 1465
trainer_state.json ADDED
@@ -0,0 +1,311 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 1628,
3
+ "best_metric": 0.964,
4
+ "best_model_checkpoint": "model_tasks/checkpoint-1628",
5
+ "epoch": 4.0,
6
+ "eval_steps": 500,
7
+ "global_step": 1628,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.12285012285012285,
14
+ "grad_norm": 58.800106048583984,
15
+ "learning_rate": 4.803921568627452e-06,
16
+ "loss": 13.935902099609375,
17
+ "step": 50
18
+ },
19
+ {
20
+ "epoch": 0.2457002457002457,
21
+ "grad_norm": 20.866506576538086,
22
+ "learning_rate": 9.705882352941177e-06,
23
+ "loss": 2.0049127197265624,
24
+ "step": 100
25
+ },
26
+ {
27
+ "epoch": 0.36855036855036855,
28
+ "grad_norm": 47.32191467285156,
29
+ "learning_rate": 1.4607843137254903e-05,
30
+ "loss": 1.2294308471679687,
31
+ "step": 150
32
+ },
33
+ {
34
+ "epoch": 0.4914004914004914,
35
+ "grad_norm": 22.775053024291992,
36
+ "learning_rate": 1.950980392156863e-05,
37
+ "loss": 0.9614788818359375,
38
+ "step": 200
39
+ },
40
+ {
41
+ "epoch": 0.6142506142506142,
42
+ "grad_norm": 20.26030731201172,
43
+ "learning_rate": 1.9970207816945425e-05,
44
+ "loss": 0.7626658630371094,
45
+ "step": 250
46
+ },
47
+ {
48
+ "epoch": 0.7371007371007371,
49
+ "grad_norm": 15.181203842163086,
50
+ "learning_rate": 1.9867450374363293e-05,
51
+ "loss": 0.7171074676513672,
52
+ "step": 300
53
+ },
54
+ {
55
+ "epoch": 0.85995085995086,
56
+ "grad_norm": 30.844865798950195,
57
+ "learning_rate": 1.9692115492385916e-05,
58
+ "loss": 0.6501062774658203,
59
+ "step": 350
60
+ },
61
+ {
62
+ "epoch": 0.9828009828009828,
63
+ "grad_norm": 9.524636268615723,
64
+ "learning_rate": 1.944549280068335e-05,
65
+ "loss": 0.5243024063110352,
66
+ "step": 400
67
+ },
68
+ {
69
+ "epoch": 1.0,
70
+ "eval_cls_accuracy": 0.902,
71
+ "eval_cls_f1": 0.9019525450317953,
72
+ "eval_loss": 0.48792028427124023,
73
+ "eval_runtime": 2.3223,
74
+ "eval_samples_per_second": 215.305,
75
+ "eval_sim_mae": 0.366321861743927,
76
+ "eval_steps_per_second": 6.89,
77
+ "step": 407
78
+ },
79
+ {
80
+ "epoch": 1.1056511056511056,
81
+ "grad_norm": 12.419134140014648,
82
+ "learning_rate": 1.9129396267685277e-05,
83
+ "loss": 0.41418304443359377,
84
+ "step": 450
85
+ },
86
+ {
87
+ "epoch": 1.2285012285012284,
88
+ "grad_norm": 18.077287673950195,
89
+ "learning_rate": 1.874615085841268e-05,
90
+ "loss": 0.3944705581665039,
91
+ "step": 500
92
+ },
93
+ {
94
+ "epoch": 1.3513513513513513,
95
+ "grad_norm": 8.001004219055176,
96
+ "learning_rate": 1.829857543380833e-05,
97
+ "loss": 0.42740669250488283,
98
+ "step": 550
99
+ },
100
+ {
101
+ "epoch": 1.4742014742014742,
102
+ "grad_norm": 20.04601287841797,
103
+ "learning_rate": 1.7789962017345527e-05,
104
+ "loss": 0.389661865234375,
105
+ "step": 600
106
+ },
107
+ {
108
+ "epoch": 1.597051597051597,
109
+ "grad_norm": 6.977843284606934,
110
+ "learning_rate": 1.7224051581414144e-05,
111
+ "loss": 0.38964271545410156,
112
+ "step": 650
113
+ },
114
+ {
115
+ "epoch": 1.71990171990172,
116
+ "grad_norm": 7.663310527801514,
117
+ "learning_rate": 1.6605006531580833e-05,
118
+ "loss": 0.35614356994628904,
119
+ "step": 700
120
+ },
121
+ {
122
+ "epoch": 1.8427518427518428,
123
+ "grad_norm": 12.420454978942871,
124
+ "learning_rate": 1.593738009110821e-05,
125
+ "loss": 0.320499153137207,
126
+ "step": 750
127
+ },
128
+ {
129
+ "epoch": 1.9656019656019657,
130
+ "grad_norm": 13.657429695129395,
131
+ "learning_rate": 1.5226082810917096e-05,
132
+ "loss": 0.3286134719848633,
133
+ "step": 800
134
+ },
135
+ {
136
+ "epoch": 2.0,
137
+ "eval_cls_accuracy": 0.946,
138
+ "eval_cls_f1": 0.9459513562205986,
139
+ "eval_loss": 0.31798821687698364,
140
+ "eval_runtime": 2.3034,
141
+ "eval_samples_per_second": 217.067,
142
+ "eval_sim_mae": 0.2837124764919281,
143
+ "eval_steps_per_second": 6.946,
144
+ "step": 814
145
+ },
146
+ {
147
+ "epoch": 2.0884520884520885,
148
+ "grad_norm": 3.6505086421966553,
149
+ "learning_rate": 1.4476346451319078e-05,
150
+ "loss": 0.2602015495300293,
151
+ "step": 850
152
+ },
153
+ {
154
+ "epoch": 2.211302211302211,
155
+ "grad_norm": 7.000202655792236,
156
+ "learning_rate": 1.3693685501177709e-05,
157
+ "loss": 0.20756610870361328,
158
+ "step": 900
159
+ },
160
+ {
161
+ "epoch": 2.3341523341523343,
162
+ "grad_norm": 8.487826347351074,
163
+ "learning_rate": 1.2883856617534158e-05,
164
+ "loss": 0.2469894790649414,
165
+ "step": 950
166
+ },
167
+ {
168
+ "epoch": 2.457002457002457,
169
+ "grad_norm": 13.440855979919434,
170
+ "learning_rate": 1.2052816284028395e-05,
171
+ "loss": 0.20867227554321288,
172
+ "step": 1000
173
+ },
174
+ {
175
+ "epoch": 2.57985257985258,
176
+ "grad_norm": 7.461733341217041,
177
+ "learning_rate": 1.1206676999548351e-05,
178
+ "loss": 0.21205909729003905,
179
+ "step": 1050
180
+ },
181
+ {
182
+ "epoch": 2.7027027027027026,
183
+ "grad_norm": 15.598981857299805,
184
+ "learning_rate": 1.0351662319349887e-05,
185
+ "loss": 0.21189189910888673,
186
+ "step": 1100
187
+ },
188
+ {
189
+ "epoch": 2.8255528255528253,
190
+ "grad_norm": 5.610878944396973,
191
+ "learning_rate": 9.494061079330812e-06,
192
+ "loss": 0.207319278717041,
193
+ "step": 1150
194
+ },
195
+ {
196
+ "epoch": 2.9484029484029484,
197
+ "grad_norm": 11.040838241577148,
198
+ "learning_rate": 8.640181140150297e-06,
199
+ "loss": 0.17402687072753906,
200
+ "step": 1200
201
+ },
202
+ {
203
+ "epoch": 3.0,
204
+ "eval_cls_accuracy": 0.958,
205
+ "eval_cls_f1": 0.9579917663862118,
206
+ "eval_loss": 0.28256744146347046,
207
+ "eval_runtime": 2.3027,
208
+ "eval_samples_per_second": 217.134,
209
+ "eval_sim_mae": 0.25911375880241394,
210
+ "eval_steps_per_second": 6.948,
211
+ "step": 1221
212
+ },
213
+ {
214
+ "epoch": 3.0712530712530715,
215
+ "grad_norm": 6.649824619293213,
216
+ "learning_rate": 7.79630299141665e-06,
217
+ "loss": 0.1433491039276123,
218
+ "step": 1250
219
+ },
220
+ {
221
+ "epoch": 3.194103194103194,
222
+ "grad_norm": 4.330808639526367,
223
+ "learning_rate": 6.968633557195666e-06,
224
+ "loss": 0.11451138496398926,
225
+ "step": 1300
226
+ },
227
+ {
228
+ "epoch": 3.3169533169533167,
229
+ "grad_norm": 25.754131317138672,
230
+ "learning_rate": 6.163260542611005e-06,
231
+ "loss": 0.12067122459411621,
232
+ "step": 1350
233
+ },
234
+ {
235
+ "epoch": 3.43980343980344,
236
+ "grad_norm": 3.0961501598358154,
237
+ "learning_rate": 5.386107657328183e-06,
238
+ "loss": 0.09894429206848145,
239
+ "step": 1400
240
+ },
241
+ {
242
+ "epoch": 3.562653562653563,
243
+ "grad_norm": 2.771333932876587,
244
+ "learning_rate": 4.642891045264073e-06,
245
+ "loss": 0.08938132286071777,
246
+ "step": 1450
247
+ },
248
+ {
249
+ "epoch": 3.6855036855036856,
250
+ "grad_norm": 3.6692490577697754,
251
+ "learning_rate": 3.939077240991749e-06,
252
+ "loss": 0.10362943649291992,
253
+ "step": 1500
254
+ },
255
+ {
256
+ "epoch": 3.808353808353808,
257
+ "grad_norm": 2.1008787155151367,
258
+ "learning_rate": 3.279842962081324e-06,
259
+ "loss": 0.09946866989135743,
260
+ "step": 1550
261
+ },
262
+ {
263
+ "epoch": 3.9312039312039313,
264
+ "grad_norm": 1.3774856328964233,
265
+ "learning_rate": 2.670037033113577e-06,
266
+ "loss": 0.13387378692626953,
267
+ "step": 1600
268
+ },
269
+ {
270
+ "epoch": 4.0,
271
+ "eval_cls_accuracy": 0.964,
272
+ "eval_cls_f1": 0.964,
273
+ "eval_loss": 0.25317928194999695,
274
+ "eval_runtime": 2.305,
275
+ "eval_samples_per_second": 216.923,
276
+ "eval_sim_mae": 0.2385944277048111,
277
+ "eval_steps_per_second": 6.942,
278
+ "step": 1628
279
+ }
280
+ ],
281
+ "logging_steps": 50,
282
+ "max_steps": 2035,
283
+ "num_input_tokens_seen": 0,
284
+ "num_train_epochs": 5,
285
+ "save_steps": 500,
286
+ "stateful_callbacks": {
287
+ "EarlyStoppingCallback": {
288
+ "args": {
289
+ "early_stopping_patience": 3,
290
+ "early_stopping_threshold": 0.0
291
+ },
292
+ "attributes": {
293
+ "early_stopping_patience_counter": 0
294
+ }
295
+ },
296
+ "TrainerControl": {
297
+ "args": {
298
+ "should_epoch_stop": false,
299
+ "should_evaluate": false,
300
+ "should_log": false,
301
+ "should_save": true,
302
+ "should_training_stop": false
303
+ },
304
+ "attributes": {}
305
+ }
306
+ },
307
+ "total_flos": 0.0,
308
+ "train_batch_size": 16,
309
+ "trial_name": null,
310
+ "trial_params": null
311
+ }