PuxAI commited on
Commit
5282060
·
verified ·
1 Parent(s): 5ca9620

Upload batch 10/24: mrpc/mBERT/max/seed_42 ... mrpc/mBERT/mean/seed_42

Browse files
Files changed (20) hide show
  1. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_42/all_results.json +17 -0
  2. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_42/eval_results.json +11 -0
  3. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_42/run_command.txt +1 -0
  4. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_42/train_results.json +9 -0
  5. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_42/trainer_state.json +138 -0
  6. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_43/all_results.json +17 -0
  7. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_43/eval_results.json +11 -0
  8. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_43/run_command.txt +1 -0
  9. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_43/train_results.json +9 -0
  10. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_43/trainer_state.json +138 -0
  11. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_44/all_results.json +17 -0
  12. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_44/eval_results.json +11 -0
  13. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_44/run_command.txt +1 -0
  14. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_44/train_results.json +9 -0
  15. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_44/trainer_state.json +138 -0
  16. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mean/seed_42/all_results.json +17 -0
  17. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mean/seed_42/eval_results.json +11 -0
  18. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mean/seed_42/run_command.txt +1 -0
  19. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mean/seed_42/train_results.json +9 -0
  20. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mean/seed_42/trainer_state.json +138 -0
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_42/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8357843137254902,
4
+ "eval_combined_score": 0.8570936087683713,
5
+ "eval_f1": 0.8784029038112523,
6
+ "eval_loss": 0.3859576880931854,
7
+ "eval_runtime": 1.8922,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 215.619,
10
+ "eval_steps_per_second": 2.642,
11
+ "total_flos": 630619158933504.0,
12
+ "train_loss": 0.37803170020446114,
13
+ "train_runtime": 35.9479,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 306.11,
16
+ "train_steps_per_second": 6.426
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_42/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8357843137254902,
4
+ "eval_combined_score": 0.8570936087683713,
5
+ "eval_f1": 0.8784029038112523,
6
+ "eval_loss": 0.3859576880931854,
7
+ "eval_runtime": 1.8922,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 215.619,
10
+ "eval_steps_per_second": 2.642
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_42/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 42 --output_dir result_ablation_mbert/mrpc/mBERT/max/seed_42 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy max --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_42/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 630619158933504.0,
4
+ "train_loss": 0.37803170020446114,
5
+ "train_runtime": 35.9479,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 306.11,
8
+ "train_steps_per_second": 6.426
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_42/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 2.598341226577759,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.5985,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 7.255716323852539,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.479,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 3.670036792755127,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.4684,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.803921568627451,
35
+ "eval_combined_score": 0.8253324318233041,
36
+ "eval_f1": 0.8467432950191571,
37
+ "eval_loss": 0.39329349994659424,
38
+ "eval_runtime": 2.0906,
39
+ "eval_samples_per_second": 195.162,
40
+ "eval_steps_per_second": 2.392,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 5.792549133300781,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.3743,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 9.58816909790039,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.3846,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 5.964817523956299,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3478,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8284313725490197,
67
+ "eval_combined_score": 0.849400871459695,
68
+ "eval_f1": 0.8703703703703703,
69
+ "eval_loss": 0.350210964679718,
70
+ "eval_runtime": 2.1974,
71
+ "eval_samples_per_second": 185.675,
72
+ "eval_steps_per_second": 2.275,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 4.463625431060791,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2867,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 8.163609504699707,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2565,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 6.111831188201904,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2384,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8357843137254902,
99
+ "eval_combined_score": 0.8570936087683713,
100
+ "eval_f1": 0.8784029038112523,
101
+ "eval_loss": 0.3859576880931854,
102
+ "eval_runtime": 1.972,
103
+ "eval_samples_per_second": 206.893,
104
+ "eval_steps_per_second": 2.535,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 630619158933504.0,
111
+ "train_loss": 0.37803170020446114,
112
+ "train_runtime": 35.9479,
113
+ "train_samples_per_second": 306.11,
114
+ "train_steps_per_second": 6.426
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 630619158933504.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_43/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8529411764705882,
4
+ "eval_combined_score": 0.8717260626878489,
5
+ "eval_f1": 0.8905109489051095,
6
+ "eval_loss": 0.3556552827358246,
7
+ "eval_runtime": 1.6058,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 254.085,
10
+ "eval_steps_per_second": 3.114,
11
+ "total_flos": 628599578480640.0,
12
+ "train_loss": 0.3737406565513446,
13
+ "train_runtime": 38.0938,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 288.866,
16
+ "train_steps_per_second": 6.064
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_43/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8529411764705882,
4
+ "eval_combined_score": 0.8717260626878489,
5
+ "eval_f1": 0.8905109489051095,
6
+ "eval_loss": 0.3556552827358246,
7
+ "eval_runtime": 1.6058,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 254.085,
10
+ "eval_steps_per_second": 3.114
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_43/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 43 --output_dir result_ablation_mbert/mrpc/mBERT/max/seed_43 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy max --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_43/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 628599578480640.0,
4
+ "train_loss": 0.3737406565513446,
5
+ "train_runtime": 38.0938,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 288.866,
8
+ "train_steps_per_second": 6.064
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_43/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 2.613507032394409,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.5876,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 2.779635429382324,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5059,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 4.840301036834717,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.4632,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.8333333333333334,
35
+ "eval_combined_score": 0.8552948255114321,
36
+ "eval_f1": 0.8772563176895307,
37
+ "eval_loss": 0.360188364982605,
38
+ "eval_runtime": 1.8153,
39
+ "eval_samples_per_second": 224.757,
40
+ "eval_steps_per_second": 2.754,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 5.261049747467041,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.3803,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 5.005692481994629,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.3665,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 13.645220756530762,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3366,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8259803921568627,
67
+ "eval_combined_score": 0.8461352054946272,
68
+ "eval_f1": 0.8662900188323918,
69
+ "eval_loss": 0.3570290505886078,
70
+ "eval_runtime": 2.0203,
71
+ "eval_samples_per_second": 201.946,
72
+ "eval_steps_per_second": 2.475,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 5.498772621154785,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2505,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 12.274273872375488,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2541,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 14.405874252319336,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2505,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8529411764705882,
99
+ "eval_combined_score": 0.8717260626878489,
100
+ "eval_f1": 0.8905109489051095,
101
+ "eval_loss": 0.3556552827358246,
102
+ "eval_runtime": 1.6412,
103
+ "eval_samples_per_second": 248.594,
104
+ "eval_steps_per_second": 3.046,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 628599578480640.0,
111
+ "train_loss": 0.3737406565513446,
112
+ "train_runtime": 38.0938,
113
+ "train_samples_per_second": 288.866,
114
+ "train_steps_per_second": 6.064
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 628599578480640.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_44/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8627450980392157,
4
+ "eval_combined_score": 0.8811933375500738,
5
+ "eval_f1": 0.899641577060932,
6
+ "eval_loss": 0.3449813723564148,
7
+ "eval_runtime": 1.4962,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 272.692,
10
+ "eval_steps_per_second": 3.342,
11
+ "total_flos": 629526768279552.0,
12
+ "train_loss": 0.3843384521864193,
13
+ "train_runtime": 35.4031,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 310.82,
16
+ "train_steps_per_second": 6.525
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_44/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8627450980392157,
4
+ "eval_combined_score": 0.8811933375500738,
5
+ "eval_f1": 0.899641577060932,
6
+ "eval_loss": 0.3449813723564148,
7
+ "eval_runtime": 1.4962,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 272.692,
10
+ "eval_steps_per_second": 3.342
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_44/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 44 --output_dir result_ablation_mbert/mrpc/mBERT/max/seed_44 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy max --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_44/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 629526768279552.0,
4
+ "train_loss": 0.3843384521864193,
5
+ "train_runtime": 35.4031,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 310.82,
8
+ "train_steps_per_second": 6.525
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/max/seed_44/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 1.7536025047302246,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6077,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 3.8616058826446533,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5398,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 4.83195686340332,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.4447,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.7573529411764706,
35
+ "eval_combined_score": 0.7749028856825749,
36
+ "eval_f1": 0.7924528301886793,
37
+ "eval_loss": 0.4518143832683563,
38
+ "eval_runtime": 2.0675,
39
+ "eval_samples_per_second": 197.337,
40
+ "eval_steps_per_second": 2.418,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 7.229933261871338,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.385,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 5.55099630355835,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.3622,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 5.723285675048828,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3733,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8455882352941176,
67
+ "eval_combined_score": 0.8658320923306031,
68
+ "eval_f1": 0.8860759493670886,
69
+ "eval_loss": 0.33651044964790344,
70
+ "eval_runtime": 1.5903,
71
+ "eval_samples_per_second": 256.549,
72
+ "eval_steps_per_second": 3.144,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 7.109714031219482,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2741,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 7.071986675262451,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2498,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 3.7733166217803955,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.258,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8627450980392157,
99
+ "eval_combined_score": 0.8811933375500738,
100
+ "eval_f1": 0.899641577060932,
101
+ "eval_loss": 0.3449813723564148,
102
+ "eval_runtime": 1.3102,
103
+ "eval_samples_per_second": 311.407,
104
+ "eval_steps_per_second": 3.816,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 629526768279552.0,
111
+ "train_loss": 0.3843384521864193,
112
+ "train_runtime": 35.4031,
113
+ "train_samples_per_second": 310.82,
114
+ "train_steps_per_second": 6.525
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 629526768279552.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mean/seed_42/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8406862745098039,
4
+ "eval_combined_score": 0.8617845786963434,
5
+ "eval_f1": 0.8828828828828829,
6
+ "eval_loss": 0.3512035310268402,
7
+ "eval_runtime": 1.4064,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 290.1,
10
+ "eval_steps_per_second": 3.555,
11
+ "total_flos": 630619158933504.0,
12
+ "train_loss": 0.38461016886162036,
13
+ "train_runtime": 32.4466,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 339.142,
16
+ "train_steps_per_second": 7.119
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mean/seed_42/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8406862745098039,
4
+ "eval_combined_score": 0.8617845786963434,
5
+ "eval_f1": 0.8828828828828829,
6
+ "eval_loss": 0.3512035310268402,
7
+ "eval_runtime": 1.4064,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 290.1,
10
+ "eval_steps_per_second": 3.555
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mean/seed_42/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 42 --output_dir result_ablation_mbert/mrpc/mBERT/mean/seed_42 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy mean --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mean/seed_42/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 630619158933504.0,
4
+ "train_loss": 0.38461016886162036,
5
+ "train_runtime": 32.4466,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 339.142,
8
+ "train_steps_per_second": 7.119
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mean/seed_42/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 2.099273681640625,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6143,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 8.029365539550781,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5179,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 3.3279473781585693,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.5085,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.8259803921568627,
35
+ "eval_combined_score": 0.8458824456058416,
36
+ "eval_f1": 0.8657844990548205,
37
+ "eval_loss": 0.4006221890449524,
38
+ "eval_runtime": 1.6069,
39
+ "eval_samples_per_second": 253.904,
40
+ "eval_steps_per_second": 3.112,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 6.741519927978516,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.3848,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 6.245471000671387,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.388,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 7.738393306732178,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3445,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8553921568627451,
67
+ "eval_combined_score": 0.8752982098700937,
68
+ "eval_f1": 0.8952042628774423,
69
+ "eval_loss": 0.332045316696167,
70
+ "eval_runtime": 1.4556,
71
+ "eval_samples_per_second": 280.291,
72
+ "eval_steps_per_second": 3.435,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 3.555630922317505,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2704,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 9.103394508361816,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2436,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 5.559789180755615,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2216,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8406862745098039,
99
+ "eval_combined_score": 0.8617845786963434,
100
+ "eval_f1": 0.8828828828828829,
101
+ "eval_loss": 0.3512035310268402,
102
+ "eval_runtime": 1.3617,
103
+ "eval_samples_per_second": 299.627,
104
+ "eval_steps_per_second": 3.672,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 630619158933504.0,
111
+ "train_loss": 0.38461016886162036,
112
+ "train_runtime": 32.4466,
113
+ "train_samples_per_second": 339.142,
114
+ "train_steps_per_second": 7.119
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 630619158933504.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }