PuxAI commited on
Commit
8906fde
·
verified ·
1 Parent(s): 8d2cb72

Upload batch 8/24: mrpc/mBERT/cls/seed_43 ... mrpc/mBERT/gated_multi_branch/seed_43

Browse files
Files changed (20) hide show
  1. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_43/all_results.json +17 -0
  2. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_43/eval_results.json +11 -0
  3. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_43/run_command.txt +1 -0
  4. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_43/train_results.json +9 -0
  5. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_43/trainer_state.json +138 -0
  6. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_44/all_results.json +17 -0
  7. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_44/eval_results.json +11 -0
  8. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_44/run_command.txt +1 -0
  9. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_44/train_results.json +9 -0
  10. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_44/trainer_state.json +138 -0
  11. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_42/all_results.json +17 -0
  12. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_42/eval_results.json +11 -0
  13. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_42/run_command.txt +1 -0
  14. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_42/train_results.json +9 -0
  15. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_42/trainer_state.json +138 -0
  16. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_43/all_results.json +17 -0
  17. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_43/eval_results.json +11 -0
  18. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_43/run_command.txt +1 -0
  19. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_43/train_results.json +9 -0
  20. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_43/trainer_state.json +138 -0
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_43/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8455882352941176,
4
+ "eval_combined_score": 0.8658320923306031,
5
+ "eval_f1": 0.8860759493670886,
6
+ "eval_loss": 0.3552929759025574,
7
+ "eval_runtime": 1.4664,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 278.234,
10
+ "eval_steps_per_second": 3.41,
11
+ "total_flos": 628599578480640.0,
12
+ "train_loss": 0.38404927728496074,
13
+ "train_runtime": 38.3271,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 287.108,
16
+ "train_steps_per_second": 6.027
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_43/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8455882352941176,
4
+ "eval_combined_score": 0.8658320923306031,
5
+ "eval_f1": 0.8860759493670886,
6
+ "eval_loss": 0.3552929759025574,
7
+ "eval_runtime": 1.4664,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 278.234,
10
+ "eval_steps_per_second": 3.41
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_43/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 43 --output_dir result_ablation_mbert/mrpc/mBERT/cls/seed_43 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy cls --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_43/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 628599578480640.0,
4
+ "train_loss": 0.38404927728496074,
5
+ "train_runtime": 38.3271,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 287.108,
8
+ "train_steps_per_second": 6.027
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_43/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 3.477534055709839,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.5857,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 5.610284805297852,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5375,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 3.8447365760803223,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.4838,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.8063725490196079,
35
+ "eval_combined_score": 0.8378970183114568,
36
+ "eval_f1": 0.8694214876033057,
37
+ "eval_loss": 0.39049965143203735,
38
+ "eval_runtime": 1.948,
39
+ "eval_samples_per_second": 209.445,
40
+ "eval_steps_per_second": 2.567,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 8.335118293762207,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.385,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 5.412845134735107,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.3788,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 14.577869415283203,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3731,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8333333333333334,
67
+ "eval_combined_score": 0.8527568922305764,
68
+ "eval_f1": 0.8721804511278195,
69
+ "eval_loss": 0.3599551320075989,
70
+ "eval_runtime": 1.6301,
71
+ "eval_samples_per_second": 250.291,
72
+ "eval_steps_per_second": 3.067,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 6.724405288696289,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2544,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 5.845699310302734,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2513,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 11.254636764526367,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2426,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8455882352941176,
99
+ "eval_combined_score": 0.8658320923306031,
100
+ "eval_f1": 0.8860759493670886,
101
+ "eval_loss": 0.3552929759025574,
102
+ "eval_runtime": 1.6621,
103
+ "eval_samples_per_second": 245.469,
104
+ "eval_steps_per_second": 3.008,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 628599578480640.0,
111
+ "train_loss": 0.38404927728496074,
112
+ "train_runtime": 38.3271,
113
+ "train_samples_per_second": 287.108,
114
+ "train_steps_per_second": 6.027
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 628599578480640.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_44/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8480392156862745,
4
+ "eval_combined_score": 0.8676559714795009,
5
+ "eval_f1": 0.8872727272727273,
6
+ "eval_loss": 0.337443470954895,
7
+ "eval_runtime": 1.669,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 244.452,
10
+ "eval_steps_per_second": 2.996,
11
+ "total_flos": 629526768279552.0,
12
+ "train_loss": 0.3921152353286743,
13
+ "train_runtime": 37.5948,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 292.7,
16
+ "train_steps_per_second": 6.144
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_44/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8480392156862745,
4
+ "eval_combined_score": 0.8676559714795009,
5
+ "eval_f1": 0.8872727272727273,
6
+ "eval_loss": 0.337443470954895,
7
+ "eval_runtime": 1.669,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 244.452,
10
+ "eval_steps_per_second": 2.996
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_44/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 44 --output_dir result_ablation_mbert/mrpc/mBERT/cls/seed_44 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy cls --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_44/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 629526768279552.0,
4
+ "train_loss": 0.3921152353286743,
5
+ "train_runtime": 37.5948,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 292.7,
8
+ "train_steps_per_second": 6.144
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_44/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 2.307070732116699,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6162,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 3.4895105361938477,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.566,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 4.919632434844971,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.4645,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.7769607843137255,
35
+ "eval_combined_score": 0.7961883029073699,
36
+ "eval_f1": 0.8154158215010142,
37
+ "eval_loss": 0.4386051893234253,
38
+ "eval_runtime": 1.8335,
39
+ "eval_samples_per_second": 222.522,
40
+ "eval_steps_per_second": 2.727,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 4.3901472091674805,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.3849,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 4.093626022338867,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.3885,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 5.644167423248291,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3752,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8602941176470589,
67
+ "eval_combined_score": 0.880059185361315,
68
+ "eval_f1": 0.8998242530755711,
69
+ "eval_loss": 0.3410514295101166,
70
+ "eval_runtime": 1.4199,
71
+ "eval_samples_per_second": 287.344,
72
+ "eval_steps_per_second": 3.521,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 7.801192283630371,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.265,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 6.680178642272949,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2518,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 3.9861366748809814,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2507,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8480392156862745,
99
+ "eval_combined_score": 0.8676559714795009,
100
+ "eval_f1": 0.8872727272727273,
101
+ "eval_loss": 0.337443470954895,
102
+ "eval_runtime": 1.4638,
103
+ "eval_samples_per_second": 278.73,
104
+ "eval_steps_per_second": 3.416,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 629526768279552.0,
111
+ "train_loss": 0.3921152353286743,
112
+ "train_runtime": 37.5948,
113
+ "train_samples_per_second": 292.7,
114
+ "train_steps_per_second": 6.144
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 629526768279552.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_42/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8382352941176471,
4
+ "eval_combined_score": 0.859977862112587,
5
+ "eval_f1": 0.8817204301075269,
6
+ "eval_loss": 0.3540915548801422,
7
+ "eval_runtime": 1.5523,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 262.84,
10
+ "eval_steps_per_second": 3.221,
11
+ "total_flos": 650826664755696.0,
12
+ "train_loss": 0.3987341035496105,
13
+ "train_runtime": 41.3742,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 265.963,
16
+ "train_steps_per_second": 5.583
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_42/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8382352941176471,
4
+ "eval_combined_score": 0.859977862112587,
5
+ "eval_f1": 0.8817204301075269,
6
+ "eval_loss": 0.3540915548801422,
7
+ "eval_runtime": 1.5523,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 262.84,
10
+ "eval_steps_per_second": 3.221
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_42/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 42 --output_dir result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_42 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy gated_multi_branch --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_42/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 650826664755696.0,
4
+ "train_loss": 0.3987341035496105,
5
+ "train_runtime": 41.3742,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 265.963,
8
+ "train_steps_per_second": 5.583
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_42/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 5.213130474090576,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6228,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 5.876645565032959,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5401,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 3.7962708473205566,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.53,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.7720588235294118,
35
+ "eval_combined_score": 0.78975611983924,
36
+ "eval_f1": 0.8074534161490683,
37
+ "eval_loss": 0.49036601185798645,
38
+ "eval_runtime": 1.9676,
39
+ "eval_samples_per_second": 207.358,
40
+ "eval_steps_per_second": 2.541,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 4.581447124481201,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.4199,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 8.923229217529297,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.397,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 7.470593452453613,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3516,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8504901960784313,
67
+ "eval_combined_score": 0.8725680686782484,
68
+ "eval_f1": 0.8946459412780656,
69
+ "eval_loss": 0.34462273120880127,
70
+ "eval_runtime": 2.1505,
71
+ "eval_samples_per_second": 189.723,
72
+ "eval_steps_per_second": 2.325,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 4.34853458404541,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2772,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 11.729267120361328,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2533,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 7.546706676483154,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2313,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8382352941176471,
99
+ "eval_combined_score": 0.859977862112587,
100
+ "eval_f1": 0.8817204301075269,
101
+ "eval_loss": 0.3540915548801422,
102
+ "eval_runtime": 1.6467,
103
+ "eval_samples_per_second": 247.767,
104
+ "eval_steps_per_second": 3.036,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 650826664755696.0,
111
+ "train_loss": 0.3987341035496105,
112
+ "train_runtime": 41.3742,
113
+ "train_samples_per_second": 265.963,
114
+ "train_steps_per_second": 5.583
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 650826664755696.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_43/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8333333333333334,
4
+ "eval_combined_score": 0.8565959952885749,
5
+ "eval_f1": 0.8798586572438163,
6
+ "eval_loss": 0.3669602572917938,
7
+ "eval_runtime": 1.2886,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 316.624,
10
+ "eval_steps_per_second": 3.88,
11
+ "total_flos": 648742369041360.0,
12
+ "train_loss": 0.3874885788211575,
13
+ "train_runtime": 40.7954,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 269.736,
16
+ "train_steps_per_second": 5.662
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_43/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8333333333333334,
4
+ "eval_combined_score": 0.8565959952885749,
5
+ "eval_f1": 0.8798586572438163,
6
+ "eval_loss": 0.3669602572917938,
7
+ "eval_runtime": 1.2886,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 316.624,
10
+ "eval_steps_per_second": 3.88
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_43/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 43 --output_dir result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_43 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy gated_multi_branch --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_43/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 648742369041360.0,
4
+ "train_loss": 0.3874885788211575,
5
+ "train_runtime": 40.7954,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 269.736,
8
+ "train_steps_per_second": 5.662
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_43/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 5.391201496124268,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6214,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 2.0320703983306885,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5583,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 4.242596626281738,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.494,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.7990196078431373,
35
+ "eval_combined_score": 0.8327345596218945,
36
+ "eval_f1": 0.8664495114006515,
37
+ "eval_loss": 0.4170113503932953,
38
+ "eval_runtime": 2.0181,
39
+ "eval_samples_per_second": 202.168,
40
+ "eval_steps_per_second": 2.478,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 7.784523010253906,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.397,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 4.2649006843566895,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.3888,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 8.975968360900879,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3506,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8284313725490197,
67
+ "eval_combined_score": 0.8505793226381462,
68
+ "eval_f1": 0.8727272727272727,
69
+ "eval_loss": 0.35200247168540955,
70
+ "eval_runtime": 1.838,
71
+ "eval_samples_per_second": 221.978,
72
+ "eval_steps_per_second": 2.72,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 6.934613227844238,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2421,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 7.820345401763916,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.24,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 12.318483352661133,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2461,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8333333333333334,
99
+ "eval_combined_score": 0.8565959952885749,
100
+ "eval_f1": 0.8798586572438163,
101
+ "eval_loss": 0.3669602572917938,
102
+ "eval_runtime": 1.3078,
103
+ "eval_samples_per_second": 311.984,
104
+ "eval_steps_per_second": 3.823,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 648742369041360.0,
111
+ "train_loss": 0.3874885788211575,
112
+ "train_runtime": 40.7954,
113
+ "train_samples_per_second": 269.736,
114
+ "train_steps_per_second": 5.662
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 648742369041360.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }