PuxAI commited on
Commit
8fe1689
·
verified ·
1 Parent(s): 84a7cd8

Upload batch 1/24: cola/mBERT/attention/seed_42 ... cola/mBERT/cls/seed_42

Browse files
Files changed (20) hide show
  1. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_42/all_results.json +15 -0
  2. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_42/eval_results.json +9 -0
  3. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_42/run_command.txt +1 -0
  4. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_42/train_results.json +9 -0
  5. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_42/trainer_state.json +216 -0
  6. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_43/all_results.json +15 -0
  7. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_43/eval_results.json +9 -0
  8. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_43/run_command.txt +1 -0
  9. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_43/train_results.json +9 -0
  10. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_43/trainer_state.json +216 -0
  11. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_44/all_results.json +15 -0
  12. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_44/eval_results.json +9 -0
  13. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_44/run_command.txt +1 -0
  14. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_44/train_results.json +9 -0
  15. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_44/trainer_state.json +216 -0
  16. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/cls/seed_42/all_results.json +15 -0
  17. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/cls/seed_42/eval_results.json +9 -0
  18. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/cls/seed_42/run_command.txt +1 -0
  19. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/cls/seed_42/train_results.json +9 -0
  20. mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/cls/seed_42/trainer_state.json +216 -0
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_42/all_results.json ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_loss": 0.30340734124183655,
4
+ "eval_matthews_correlation": 0.7706218489153343,
5
+ "eval_runtime": 1.3797,
6
+ "eval_samples": 1043,
7
+ "eval_samples_per_second": 755.971,
8
+ "eval_steps_per_second": 7.973,
9
+ "total_flos": 395039042732628.0,
10
+ "train_loss": 0.2244898515928613,
11
+ "train_runtime": 68.4246,
12
+ "train_samples": 8551,
13
+ "train_samples_per_second": 374.909,
14
+ "train_steps_per_second": 7.848
15
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_42/eval_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_loss": 0.30340734124183655,
4
+ "eval_matthews_correlation": 0.7706218489153343,
5
+ "eval_runtime": 1.3797,
6
+ "eval_samples": 1043,
7
+ "eval_samples_per_second": 755.971,
8
+ "eval_steps_per_second": 7.973
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_42/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name cola --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 42 --output_dir result_ablation_mbert/cola/mBERT/attention/seed_42 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy attention --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_42/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 395039042732628.0,
4
+ "train_loss": 0.2244898515928613,
5
+ "train_runtime": 68.4246,
6
+ "train_samples": 8551,
7
+ "train_samples_per_second": 374.909,
8
+ "train_steps_per_second": 7.848
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_42/trainer_state.json ADDED
@@ -0,0 +1,216 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 537,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.13966480446927373,
13
+ "grad_norm": 8.298686981201172,
14
+ "learning_rate": 2.8603351955307262e-05,
15
+ "loss": 0.4887,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.27932960893854747,
20
+ "grad_norm": 6.113591194152832,
21
+ "learning_rate": 2.7206703910614527e-05,
22
+ "loss": 0.4133,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.41899441340782123,
27
+ "grad_norm": 7.69141149520874,
28
+ "learning_rate": 2.5810055865921788e-05,
29
+ "loss": 0.3193,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 0.5586592178770949,
34
+ "grad_norm": 5.14018440246582,
35
+ "learning_rate": 2.441340782122905e-05,
36
+ "loss": 0.3274,
37
+ "step": 100
38
+ },
39
+ {
40
+ "epoch": 0.6983240223463687,
41
+ "grad_norm": 5.4107584953308105,
42
+ "learning_rate": 2.3016759776536314e-05,
43
+ "loss": 0.3402,
44
+ "step": 125
45
+ },
46
+ {
47
+ "epoch": 0.8379888268156425,
48
+ "grad_norm": 9.844621658325195,
49
+ "learning_rate": 2.1620111731843575e-05,
50
+ "loss": 0.2803,
51
+ "step": 150
52
+ },
53
+ {
54
+ "epoch": 0.9776536312849162,
55
+ "grad_norm": 7.570620536804199,
56
+ "learning_rate": 2.0223463687150836e-05,
57
+ "loss": 0.3132,
58
+ "step": 175
59
+ },
60
+ {
61
+ "epoch": 1.0,
62
+ "eval_loss": 0.25700780749320984,
63
+ "eval_matthews_correlation": 0.7686079913089925,
64
+ "eval_runtime": 1.6531,
65
+ "eval_samples_per_second": 630.95,
66
+ "eval_steps_per_second": 6.654,
67
+ "step": 179
68
+ },
69
+ {
70
+ "epoch": 1.1173184357541899,
71
+ "grad_norm": 6.16119909286499,
72
+ "learning_rate": 1.88268156424581e-05,
73
+ "loss": 0.256,
74
+ "step": 200
75
+ },
76
+ {
77
+ "epoch": 1.2569832402234637,
78
+ "grad_norm": 6.379676818847656,
79
+ "learning_rate": 1.7430167597765365e-05,
80
+ "loss": 0.226,
81
+ "step": 225
82
+ },
83
+ {
84
+ "epoch": 1.3966480446927374,
85
+ "grad_norm": 2.9720115661621094,
86
+ "learning_rate": 1.6033519553072626e-05,
87
+ "loss": 0.1879,
88
+ "step": 250
89
+ },
90
+ {
91
+ "epoch": 1.536312849162011,
92
+ "grad_norm": 3.687185287475586,
93
+ "learning_rate": 1.4636871508379887e-05,
94
+ "loss": 0.1705,
95
+ "step": 275
96
+ },
97
+ {
98
+ "epoch": 1.675977653631285,
99
+ "grad_norm": 6.894290447235107,
100
+ "learning_rate": 1.324022346368715e-05,
101
+ "loss": 0.2055,
102
+ "step": 300
103
+ },
104
+ {
105
+ "epoch": 1.8156424581005588,
106
+ "grad_norm": 4.898176193237305,
107
+ "learning_rate": 1.1843575418994415e-05,
108
+ "loss": 0.183,
109
+ "step": 325
110
+ },
111
+ {
112
+ "epoch": 1.9553072625698324,
113
+ "grad_norm": 8.651183128356934,
114
+ "learning_rate": 1.0446927374301676e-05,
115
+ "loss": 0.1965,
116
+ "step": 350
117
+ },
118
+ {
119
+ "epoch": 2.0,
120
+ "eval_loss": 0.26676928997039795,
121
+ "eval_matthews_correlation": 0.7423025309306667,
122
+ "eval_runtime": 1.7705,
123
+ "eval_samples_per_second": 589.105,
124
+ "eval_steps_per_second": 6.213,
125
+ "step": 358
126
+ },
127
+ {
128
+ "epoch": 2.094972067039106,
129
+ "grad_norm": 8.692514419555664,
130
+ "learning_rate": 9.050279329608939e-06,
131
+ "loss": 0.1734,
132
+ "step": 375
133
+ },
134
+ {
135
+ "epoch": 2.2346368715083798,
136
+ "grad_norm": 11.364733695983887,
137
+ "learning_rate": 7.653631284916202e-06,
138
+ "loss": 0.1104,
139
+ "step": 400
140
+ },
141
+ {
142
+ "epoch": 2.3743016759776534,
143
+ "grad_norm": 10.94915771484375,
144
+ "learning_rate": 6.256983240223464e-06,
145
+ "loss": 0.1541,
146
+ "step": 425
147
+ },
148
+ {
149
+ "epoch": 2.5139664804469275,
150
+ "grad_norm": 5.912627696990967,
151
+ "learning_rate": 4.860335195530726e-06,
152
+ "loss": 0.1249,
153
+ "step": 450
154
+ },
155
+ {
156
+ "epoch": 2.653631284916201,
157
+ "grad_norm": 9.138338088989258,
158
+ "learning_rate": 3.463687150837989e-06,
159
+ "loss": 0.1053,
160
+ "step": 475
161
+ },
162
+ {
163
+ "epoch": 2.793296089385475,
164
+ "grad_norm": 10.012800216674805,
165
+ "learning_rate": 2.0670391061452514e-06,
166
+ "loss": 0.1039,
167
+ "step": 500
168
+ },
169
+ {
170
+ "epoch": 2.9329608938547485,
171
+ "grad_norm": 7.307399749755859,
172
+ "learning_rate": 6.70391061452514e-07,
173
+ "loss": 0.0981,
174
+ "step": 525
175
+ },
176
+ {
177
+ "epoch": 3.0,
178
+ "eval_loss": 0.30340734124183655,
179
+ "eval_matthews_correlation": 0.7706218489153343,
180
+ "eval_runtime": 1.4603,
181
+ "eval_samples_per_second": 714.214,
182
+ "eval_steps_per_second": 7.532,
183
+ "step": 537
184
+ },
185
+ {
186
+ "epoch": 3.0,
187
+ "step": 537,
188
+ "total_flos": 395039042732628.0,
189
+ "train_loss": 0.2244898515928613,
190
+ "train_runtime": 68.4246,
191
+ "train_samples_per_second": 374.909,
192
+ "train_steps_per_second": 7.848
193
+ }
194
+ ],
195
+ "logging_steps": 25,
196
+ "max_steps": 537,
197
+ "num_input_tokens_seen": 0,
198
+ "num_train_epochs": 3,
199
+ "save_steps": 500,
200
+ "stateful_callbacks": {
201
+ "TrainerControl": {
202
+ "args": {
203
+ "should_epoch_stop": false,
204
+ "should_evaluate": false,
205
+ "should_log": false,
206
+ "should_save": false,
207
+ "should_training_stop": false
208
+ },
209
+ "attributes": {}
210
+ }
211
+ },
212
+ "total_flos": 395039042732628.0,
213
+ "train_batch_size": 48,
214
+ "trial_name": null,
215
+ "trial_params": null
216
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_43/all_results.json ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_loss": 0.344061017036438,
4
+ "eval_matthews_correlation": 0.7546498935382564,
5
+ "eval_runtime": 1.3505,
6
+ "eval_samples": 1043,
7
+ "eval_samples_per_second": 772.301,
8
+ "eval_steps_per_second": 8.145,
9
+ "total_flos": 392518158405090.0,
10
+ "train_loss": 0.23256953179947268,
11
+ "train_runtime": 68.2263,
12
+ "train_samples": 8551,
13
+ "train_samples_per_second": 375.999,
14
+ "train_steps_per_second": 7.871
15
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_43/eval_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_loss": 0.344061017036438,
4
+ "eval_matthews_correlation": 0.7546498935382564,
5
+ "eval_runtime": 1.3505,
6
+ "eval_samples": 1043,
7
+ "eval_samples_per_second": 772.301,
8
+ "eval_steps_per_second": 8.145
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_43/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name cola --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 43 --output_dir result_ablation_mbert/cola/mBERT/attention/seed_43 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy attention --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_43/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 392518158405090.0,
4
+ "train_loss": 0.23256953179947268,
5
+ "train_runtime": 68.2263,
6
+ "train_samples": 8551,
7
+ "train_samples_per_second": 375.999,
8
+ "train_steps_per_second": 7.871
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_43/trainer_state.json ADDED
@@ -0,0 +1,216 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 537,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.13966480446927373,
13
+ "grad_norm": 5.432812213897705,
14
+ "learning_rate": 2.8603351955307262e-05,
15
+ "loss": 0.5208,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.27932960893854747,
20
+ "grad_norm": 4.507151126861572,
21
+ "learning_rate": 2.7206703910614527e-05,
22
+ "loss": 0.41,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.41899441340782123,
27
+ "grad_norm": 5.634162902832031,
28
+ "learning_rate": 2.5810055865921788e-05,
29
+ "loss": 0.3583,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 0.5586592178770949,
34
+ "grad_norm": 6.021278381347656,
35
+ "learning_rate": 2.441340782122905e-05,
36
+ "loss": 0.3426,
37
+ "step": 100
38
+ },
39
+ {
40
+ "epoch": 0.6983240223463687,
41
+ "grad_norm": 3.303103446960449,
42
+ "learning_rate": 2.3016759776536314e-05,
43
+ "loss": 0.3307,
44
+ "step": 125
45
+ },
46
+ {
47
+ "epoch": 0.8379888268156425,
48
+ "grad_norm": 6.159351825714111,
49
+ "learning_rate": 2.1620111731843575e-05,
50
+ "loss": 0.3318,
51
+ "step": 150
52
+ },
53
+ {
54
+ "epoch": 0.9776536312849162,
55
+ "grad_norm": 5.0855712890625,
56
+ "learning_rate": 2.0223463687150836e-05,
57
+ "loss": 0.3191,
58
+ "step": 175
59
+ },
60
+ {
61
+ "epoch": 1.0,
62
+ "eval_loss": 0.2599124014377594,
63
+ "eval_matthews_correlation": 0.7375376126207708,
64
+ "eval_runtime": 1.6317,
65
+ "eval_samples_per_second": 639.198,
66
+ "eval_steps_per_second": 6.741,
67
+ "step": 179
68
+ },
69
+ {
70
+ "epoch": 1.1173184357541899,
71
+ "grad_norm": 7.605750560760498,
72
+ "learning_rate": 1.88268156424581e-05,
73
+ "loss": 0.2701,
74
+ "step": 200
75
+ },
76
+ {
77
+ "epoch": 1.2569832402234637,
78
+ "grad_norm": 6.322093963623047,
79
+ "learning_rate": 1.7430167597765365e-05,
80
+ "loss": 0.2025,
81
+ "step": 225
82
+ },
83
+ {
84
+ "epoch": 1.3966480446927374,
85
+ "grad_norm": 10.499807357788086,
86
+ "learning_rate": 1.6033519553072626e-05,
87
+ "loss": 0.2198,
88
+ "step": 250
89
+ },
90
+ {
91
+ "epoch": 1.536312849162011,
92
+ "grad_norm": 5.4613189697265625,
93
+ "learning_rate": 1.4636871508379887e-05,
94
+ "loss": 0.2271,
95
+ "step": 275
96
+ },
97
+ {
98
+ "epoch": 1.675977653631285,
99
+ "grad_norm": 6.360593795776367,
100
+ "learning_rate": 1.324022346368715e-05,
101
+ "loss": 0.1812,
102
+ "step": 300
103
+ },
104
+ {
105
+ "epoch": 1.8156424581005588,
106
+ "grad_norm": 7.707641124725342,
107
+ "learning_rate": 1.1843575418994415e-05,
108
+ "loss": 0.1736,
109
+ "step": 325
110
+ },
111
+ {
112
+ "epoch": 1.9553072625698324,
113
+ "grad_norm": 4.31608772277832,
114
+ "learning_rate": 1.0446927374301676e-05,
115
+ "loss": 0.187,
116
+ "step": 350
117
+ },
118
+ {
119
+ "epoch": 2.0,
120
+ "eval_loss": 0.27209946513175964,
121
+ "eval_matthews_correlation": 0.7517811010300938,
122
+ "eval_runtime": 1.6132,
123
+ "eval_samples_per_second": 646.524,
124
+ "eval_steps_per_second": 6.819,
125
+ "step": 358
126
+ },
127
+ {
128
+ "epoch": 2.094972067039106,
129
+ "grad_norm": 7.300499439239502,
130
+ "learning_rate": 9.050279329608939e-06,
131
+ "loss": 0.1443,
132
+ "step": 375
133
+ },
134
+ {
135
+ "epoch": 2.2346368715083798,
136
+ "grad_norm": 4.6428961753845215,
137
+ "learning_rate": 7.653631284916202e-06,
138
+ "loss": 0.1341,
139
+ "step": 400
140
+ },
141
+ {
142
+ "epoch": 2.3743016759776534,
143
+ "grad_norm": 8.466405868530273,
144
+ "learning_rate": 6.256983240223464e-06,
145
+ "loss": 0.1163,
146
+ "step": 425
147
+ },
148
+ {
149
+ "epoch": 2.5139664804469275,
150
+ "grad_norm": 5.116489410400391,
151
+ "learning_rate": 4.860335195530726e-06,
152
+ "loss": 0.1129,
153
+ "step": 450
154
+ },
155
+ {
156
+ "epoch": 2.653631284916201,
157
+ "grad_norm": 9.736248016357422,
158
+ "learning_rate": 3.463687150837989e-06,
159
+ "loss": 0.1304,
160
+ "step": 475
161
+ },
162
+ {
163
+ "epoch": 2.793296089385475,
164
+ "grad_norm": 6.68882417678833,
165
+ "learning_rate": 2.0670391061452514e-06,
166
+ "loss": 0.121,
167
+ "step": 500
168
+ },
169
+ {
170
+ "epoch": 2.9329608938547485,
171
+ "grad_norm": 10.210979461669922,
172
+ "learning_rate": 6.70391061452514e-07,
173
+ "loss": 0.1115,
174
+ "step": 525
175
+ },
176
+ {
177
+ "epoch": 3.0,
178
+ "eval_loss": 0.344061017036438,
179
+ "eval_matthews_correlation": 0.7546498935382564,
180
+ "eval_runtime": 1.4369,
181
+ "eval_samples_per_second": 725.866,
182
+ "eval_steps_per_second": 7.655,
183
+ "step": 537
184
+ },
185
+ {
186
+ "epoch": 3.0,
187
+ "step": 537,
188
+ "total_flos": 392518158405090.0,
189
+ "train_loss": 0.23256953179947268,
190
+ "train_runtime": 68.2263,
191
+ "train_samples_per_second": 375.999,
192
+ "train_steps_per_second": 7.871
193
+ }
194
+ ],
195
+ "logging_steps": 25,
196
+ "max_steps": 537,
197
+ "num_input_tokens_seen": 0,
198
+ "num_train_epochs": 3,
199
+ "save_steps": 500,
200
+ "stateful_callbacks": {
201
+ "TrainerControl": {
202
+ "args": {
203
+ "should_epoch_stop": false,
204
+ "should_evaluate": false,
205
+ "should_log": false,
206
+ "should_save": false,
207
+ "should_training_stop": false
208
+ },
209
+ "attributes": {}
210
+ }
211
+ },
212
+ "total_flos": 392518158405090.0,
213
+ "train_batch_size": 48,
214
+ "trial_name": null,
215
+ "trial_params": null
216
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_44/all_results.json ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_loss": 0.3155398666858673,
4
+ "eval_matthews_correlation": 0.777661541691299,
5
+ "eval_runtime": 1.3715,
6
+ "eval_samples": 1043,
7
+ "eval_samples_per_second": 760.459,
8
+ "eval_steps_per_second": 8.02,
9
+ "total_flos": 393647729346858.0,
10
+ "train_loss": 0.22533691994970736,
11
+ "train_runtime": 68.4887,
12
+ "train_samples": 8551,
13
+ "train_samples_per_second": 374.558,
14
+ "train_steps_per_second": 7.841
15
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_44/eval_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_loss": 0.3155398666858673,
4
+ "eval_matthews_correlation": 0.777661541691299,
5
+ "eval_runtime": 1.3715,
6
+ "eval_samples": 1043,
7
+ "eval_samples_per_second": 760.459,
8
+ "eval_steps_per_second": 8.02
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_44/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name cola --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 44 --output_dir result_ablation_mbert/cola/mBERT/attention/seed_44 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy attention --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_44/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 393647729346858.0,
4
+ "train_loss": 0.22533691994970736,
5
+ "train_runtime": 68.4887,
6
+ "train_samples": 8551,
7
+ "train_samples_per_second": 374.558,
8
+ "train_steps_per_second": 7.841
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/attention/seed_44/trainer_state.json ADDED
@@ -0,0 +1,216 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 537,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.13966480446927373,
13
+ "grad_norm": 5.904765605926514,
14
+ "learning_rate": 2.8603351955307262e-05,
15
+ "loss": 0.5071,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.27932960893854747,
20
+ "grad_norm": 4.30718469619751,
21
+ "learning_rate": 2.7206703910614527e-05,
22
+ "loss": 0.4121,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.41899441340782123,
27
+ "grad_norm": 3.573841094970703,
28
+ "learning_rate": 2.5810055865921788e-05,
29
+ "loss": 0.3746,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 0.5586592178770949,
34
+ "grad_norm": 4.671476364135742,
35
+ "learning_rate": 2.441340782122905e-05,
36
+ "loss": 0.3308,
37
+ "step": 100
38
+ },
39
+ {
40
+ "epoch": 0.6983240223463687,
41
+ "grad_norm": 6.219083786010742,
42
+ "learning_rate": 2.3016759776536314e-05,
43
+ "loss": 0.3072,
44
+ "step": 125
45
+ },
46
+ {
47
+ "epoch": 0.8379888268156425,
48
+ "grad_norm": 6.215616226196289,
49
+ "learning_rate": 2.1620111731843575e-05,
50
+ "loss": 0.3127,
51
+ "step": 150
52
+ },
53
+ {
54
+ "epoch": 0.9776536312849162,
55
+ "grad_norm": 5.634036064147949,
56
+ "learning_rate": 2.0223463687150836e-05,
57
+ "loss": 0.2991,
58
+ "step": 175
59
+ },
60
+ {
61
+ "epoch": 1.0,
62
+ "eval_loss": 0.253072053194046,
63
+ "eval_matthews_correlation": 0.7470182756696736,
64
+ "eval_runtime": 1.7331,
65
+ "eval_samples_per_second": 601.828,
66
+ "eval_steps_per_second": 6.347,
67
+ "step": 179
68
+ },
69
+ {
70
+ "epoch": 1.1173184357541899,
71
+ "grad_norm": 7.406801223754883,
72
+ "learning_rate": 1.88268156424581e-05,
73
+ "loss": 0.2149,
74
+ "step": 200
75
+ },
76
+ {
77
+ "epoch": 1.2569832402234637,
78
+ "grad_norm": 7.621590614318848,
79
+ "learning_rate": 1.7430167597765365e-05,
80
+ "loss": 0.222,
81
+ "step": 225
82
+ },
83
+ {
84
+ "epoch": 1.3966480446927374,
85
+ "grad_norm": 6.2891645431518555,
86
+ "learning_rate": 1.6033519553072626e-05,
87
+ "loss": 0.2085,
88
+ "step": 250
89
+ },
90
+ {
91
+ "epoch": 1.536312849162011,
92
+ "grad_norm": 5.562518119812012,
93
+ "learning_rate": 1.4636871508379887e-05,
94
+ "loss": 0.1949,
95
+ "step": 275
96
+ },
97
+ {
98
+ "epoch": 1.675977653631285,
99
+ "grad_norm": 10.442362785339355,
100
+ "learning_rate": 1.324022346368715e-05,
101
+ "loss": 0.1903,
102
+ "step": 300
103
+ },
104
+ {
105
+ "epoch": 1.8156424581005588,
106
+ "grad_norm": 6.932034969329834,
107
+ "learning_rate": 1.1843575418994415e-05,
108
+ "loss": 0.2095,
109
+ "step": 325
110
+ },
111
+ {
112
+ "epoch": 1.9553072625698324,
113
+ "grad_norm": 8.042263984680176,
114
+ "learning_rate": 1.0446927374301676e-05,
115
+ "loss": 0.184,
116
+ "step": 350
117
+ },
118
+ {
119
+ "epoch": 2.0,
120
+ "eval_loss": 0.2911624610424042,
121
+ "eval_matthews_correlation": 0.7594788750343784,
122
+ "eval_runtime": 1.7138,
123
+ "eval_samples_per_second": 608.582,
124
+ "eval_steps_per_second": 6.418,
125
+ "step": 358
126
+ },
127
+ {
128
+ "epoch": 2.094972067039106,
129
+ "grad_norm": 13.051106452941895,
130
+ "learning_rate": 9.050279329608939e-06,
131
+ "loss": 0.1355,
132
+ "step": 375
133
+ },
134
+ {
135
+ "epoch": 2.2346368715083798,
136
+ "grad_norm": 10.083761215209961,
137
+ "learning_rate": 7.653631284916202e-06,
138
+ "loss": 0.1081,
139
+ "step": 400
140
+ },
141
+ {
142
+ "epoch": 2.3743016759776534,
143
+ "grad_norm": 7.988012790679932,
144
+ "learning_rate": 6.256983240223464e-06,
145
+ "loss": 0.1217,
146
+ "step": 425
147
+ },
148
+ {
149
+ "epoch": 2.5139664804469275,
150
+ "grad_norm": 7.611426830291748,
151
+ "learning_rate": 4.860335195530726e-06,
152
+ "loss": 0.1295,
153
+ "step": 450
154
+ },
155
+ {
156
+ "epoch": 2.653631284916201,
157
+ "grad_norm": 9.671212196350098,
158
+ "learning_rate": 3.463687150837989e-06,
159
+ "loss": 0.1123,
160
+ "step": 475
161
+ },
162
+ {
163
+ "epoch": 2.793296089385475,
164
+ "grad_norm": 0.7560170888900757,
165
+ "learning_rate": 2.0670391061452514e-06,
166
+ "loss": 0.1083,
167
+ "step": 500
168
+ },
169
+ {
170
+ "epoch": 2.9329608938547485,
171
+ "grad_norm": 7.9756245613098145,
172
+ "learning_rate": 6.70391061452514e-07,
173
+ "loss": 0.1087,
174
+ "step": 525
175
+ },
176
+ {
177
+ "epoch": 3.0,
178
+ "eval_loss": 0.3155398666858673,
179
+ "eval_matthews_correlation": 0.777661541691299,
180
+ "eval_runtime": 1.5308,
181
+ "eval_samples_per_second": 681.353,
182
+ "eval_steps_per_second": 7.186,
183
+ "step": 537
184
+ },
185
+ {
186
+ "epoch": 3.0,
187
+ "step": 537,
188
+ "total_flos": 393647729346858.0,
189
+ "train_loss": 0.22533691994970736,
190
+ "train_runtime": 68.4887,
191
+ "train_samples_per_second": 374.558,
192
+ "train_steps_per_second": 7.841
193
+ }
194
+ ],
195
+ "logging_steps": 25,
196
+ "max_steps": 537,
197
+ "num_input_tokens_seen": 0,
198
+ "num_train_epochs": 3,
199
+ "save_steps": 500,
200
+ "stateful_callbacks": {
201
+ "TrainerControl": {
202
+ "args": {
203
+ "should_epoch_stop": false,
204
+ "should_evaluate": false,
205
+ "should_log": false,
206
+ "should_save": false,
207
+ "should_training_stop": false
208
+ },
209
+ "attributes": {}
210
+ }
211
+ },
212
+ "total_flos": 393647729346858.0,
213
+ "train_batch_size": 48,
214
+ "trial_name": null,
215
+ "trial_params": null
216
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/cls/seed_42/all_results.json ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_loss": 0.3190879821777344,
4
+ "eval_matthews_correlation": 0.7493368300485673,
5
+ "eval_runtime": 1.517,
6
+ "eval_samples": 1043,
7
+ "eval_samples_per_second": 687.525,
8
+ "eval_steps_per_second": 7.251,
9
+ "total_flos": 395035512109056.0,
10
+ "train_loss": 0.23319570001499168,
11
+ "train_runtime": 70.3238,
12
+ "train_samples": 8551,
13
+ "train_samples_per_second": 364.784,
14
+ "train_steps_per_second": 7.636
15
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/cls/seed_42/eval_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_loss": 0.3190879821777344,
4
+ "eval_matthews_correlation": 0.7493368300485673,
5
+ "eval_runtime": 1.517,
6
+ "eval_samples": 1043,
7
+ "eval_samples_per_second": 687.525,
8
+ "eval_steps_per_second": 7.251
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/cls/seed_42/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name cola --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 42 --output_dir result_ablation_mbert/cola/mBERT/cls/seed_42 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy cls --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/cls/seed_42/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 395035512109056.0,
4
+ "train_loss": 0.23319570001499168,
5
+ "train_runtime": 70.3238,
6
+ "train_samples": 8551,
7
+ "train_samples_per_second": 364.784,
8
+ "train_steps_per_second": 7.636
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/cola/mBERT/cls/seed_42/trainer_state.json ADDED
@@ -0,0 +1,216 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 537,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.13966480446927373,
13
+ "grad_norm": 5.4744391441345215,
14
+ "learning_rate": 2.8603351955307262e-05,
15
+ "loss": 0.5224,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.27932960893854747,
20
+ "grad_norm": 8.66765308380127,
21
+ "learning_rate": 2.7206703910614527e-05,
22
+ "loss": 0.4164,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.41899441340782123,
27
+ "grad_norm": 5.180931091308594,
28
+ "learning_rate": 2.5810055865921788e-05,
29
+ "loss": 0.3368,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 0.5586592178770949,
34
+ "grad_norm": 5.698576927185059,
35
+ "learning_rate": 2.441340782122905e-05,
36
+ "loss": 0.3361,
37
+ "step": 100
38
+ },
39
+ {
40
+ "epoch": 0.6983240223463687,
41
+ "grad_norm": 5.160890579223633,
42
+ "learning_rate": 2.3016759776536314e-05,
43
+ "loss": 0.3484,
44
+ "step": 125
45
+ },
46
+ {
47
+ "epoch": 0.8379888268156425,
48
+ "grad_norm": 10.759689331054688,
49
+ "learning_rate": 2.1620111731843575e-05,
50
+ "loss": 0.2852,
51
+ "step": 150
52
+ },
53
+ {
54
+ "epoch": 0.9776536312849162,
55
+ "grad_norm": 6.528064250946045,
56
+ "learning_rate": 2.0223463687150836e-05,
57
+ "loss": 0.3177,
58
+ "step": 175
59
+ },
60
+ {
61
+ "epoch": 1.0,
62
+ "eval_loss": 0.2563566565513611,
63
+ "eval_matthews_correlation": 0.7513222297930762,
64
+ "eval_runtime": 1.8148,
65
+ "eval_samples_per_second": 574.707,
66
+ "eval_steps_per_second": 6.061,
67
+ "step": 179
68
+ },
69
+ {
70
+ "epoch": 1.1173184357541899,
71
+ "grad_norm": 4.215940952301025,
72
+ "learning_rate": 1.88268156424581e-05,
73
+ "loss": 0.2616,
74
+ "step": 200
75
+ },
76
+ {
77
+ "epoch": 1.2569832402234637,
78
+ "grad_norm": 5.068136215209961,
79
+ "learning_rate": 1.7430167597765365e-05,
80
+ "loss": 0.2396,
81
+ "step": 225
82
+ },
83
+ {
84
+ "epoch": 1.3966480446927374,
85
+ "grad_norm": 3.3487465381622314,
86
+ "learning_rate": 1.6033519553072626e-05,
87
+ "loss": 0.2072,
88
+ "step": 250
89
+ },
90
+ {
91
+ "epoch": 1.536312849162011,
92
+ "grad_norm": 4.20163106918335,
93
+ "learning_rate": 1.4636871508379887e-05,
94
+ "loss": 0.1794,
95
+ "step": 275
96
+ },
97
+ {
98
+ "epoch": 1.675977653631285,
99
+ "grad_norm": 4.505293846130371,
100
+ "learning_rate": 1.324022346368715e-05,
101
+ "loss": 0.2279,
102
+ "step": 300
103
+ },
104
+ {
105
+ "epoch": 1.8156424581005588,
106
+ "grad_norm": 5.202899932861328,
107
+ "learning_rate": 1.1843575418994415e-05,
108
+ "loss": 0.183,
109
+ "step": 325
110
+ },
111
+ {
112
+ "epoch": 1.9553072625698324,
113
+ "grad_norm": 9.486673355102539,
114
+ "learning_rate": 1.0446927374301676e-05,
115
+ "loss": 0.2156,
116
+ "step": 350
117
+ },
118
+ {
119
+ "epoch": 2.0,
120
+ "eval_loss": 0.2633655369281769,
121
+ "eval_matthews_correlation": 0.758860374064517,
122
+ "eval_runtime": 1.4162,
123
+ "eval_samples_per_second": 736.47,
124
+ "eval_steps_per_second": 7.767,
125
+ "step": 358
126
+ },
127
+ {
128
+ "epoch": 2.094972067039106,
129
+ "grad_norm": 5.227592468261719,
130
+ "learning_rate": 9.050279329608939e-06,
131
+ "loss": 0.1774,
132
+ "step": 375
133
+ },
134
+ {
135
+ "epoch": 2.2346368715083798,
136
+ "grad_norm": 7.751290321350098,
137
+ "learning_rate": 7.653631284916202e-06,
138
+ "loss": 0.103,
139
+ "step": 400
140
+ },
141
+ {
142
+ "epoch": 2.3743016759776534,
143
+ "grad_norm": 12.556318283081055,
144
+ "learning_rate": 6.256983240223464e-06,
145
+ "loss": 0.1537,
146
+ "step": 425
147
+ },
148
+ {
149
+ "epoch": 2.5139664804469275,
150
+ "grad_norm": 12.484012603759766,
151
+ "learning_rate": 4.860335195530726e-06,
152
+ "loss": 0.1185,
153
+ "step": 450
154
+ },
155
+ {
156
+ "epoch": 2.653631284916201,
157
+ "grad_norm": 8.79336929321289,
158
+ "learning_rate": 3.463687150837989e-06,
159
+ "loss": 0.1141,
160
+ "step": 475
161
+ },
162
+ {
163
+ "epoch": 2.793296089385475,
164
+ "grad_norm": 11.68663215637207,
165
+ "learning_rate": 2.0670391061452514e-06,
166
+ "loss": 0.112,
167
+ "step": 500
168
+ },
169
+ {
170
+ "epoch": 2.9329608938547485,
171
+ "grad_norm": 10.570063591003418,
172
+ "learning_rate": 6.70391061452514e-07,
173
+ "loss": 0.1086,
174
+ "step": 525
175
+ },
176
+ {
177
+ "epoch": 3.0,
178
+ "eval_loss": 0.3190879821777344,
179
+ "eval_matthews_correlation": 0.7493368300485673,
180
+ "eval_runtime": 1.5782,
181
+ "eval_samples_per_second": 660.878,
182
+ "eval_steps_per_second": 6.97,
183
+ "step": 537
184
+ },
185
+ {
186
+ "epoch": 3.0,
187
+ "step": 537,
188
+ "total_flos": 395035512109056.0,
189
+ "train_loss": 0.23319570001499168,
190
+ "train_runtime": 70.3238,
191
+ "train_samples_per_second": 364.784,
192
+ "train_steps_per_second": 7.636
193
+ }
194
+ ],
195
+ "logging_steps": 25,
196
+ "max_steps": 537,
197
+ "num_input_tokens_seen": 0,
198
+ "num_train_epochs": 3,
199
+ "save_steps": 500,
200
+ "stateful_callbacks": {
201
+ "TrainerControl": {
202
+ "args": {
203
+ "should_epoch_stop": false,
204
+ "should_evaluate": false,
205
+ "should_log": false,
206
+ "should_save": false,
207
+ "should_training_stop": false
208
+ },
209
+ "attributes": {}
210
+ }
211
+ },
212
+ "total_flos": 395035512109056.0,
213
+ "train_batch_size": 48,
214
+ "trial_name": null,
215
+ "trial_params": null
216
+ }