PuxAI commited on
Commit
8d2cb72
·
verified ·
1 Parent(s): 6c31fce

Upload batch 7/24: mrpc/mBERT/attention/seed_42 ... mrpc/mBERT/cls/seed_42

Browse files
Files changed (20) hide show
  1. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_42/all_results.json +17 -0
  2. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_42/eval_results.json +11 -0
  3. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_42/run_command.txt +1 -0
  4. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_42/train_results.json +9 -0
  5. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_42/trainer_state.json +138 -0
  6. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_43/all_results.json +17 -0
  7. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_43/eval_results.json +11 -0
  8. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_43/run_command.txt +1 -0
  9. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_43/train_results.json +9 -0
  10. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_43/trainer_state.json +138 -0
  11. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_44/all_results.json +17 -0
  12. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_44/eval_results.json +11 -0
  13. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_44/run_command.txt +1 -0
  14. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_44/train_results.json +9 -0
  15. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_44/trainer_state.json +138 -0
  16. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_42/all_results.json +17 -0
  17. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_42/eval_results.json +11 -0
  18. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_42/run_command.txt +1 -0
  19. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_42/train_results.json +9 -0
  20. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_42/trainer_state.json +138 -0
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_42/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.821078431372549,
4
+ "eval_combined_score": 0.8452440457399417,
5
+ "eval_f1": 0.8694096601073346,
6
+ "eval_loss": 0.39012983441352844,
7
+ "eval_runtime": 1.2955,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 314.927,
10
+ "eval_steps_per_second": 3.859,
11
+ "total_flos": 630624795082152.0,
12
+ "train_loss": 0.38344859509241014,
13
+ "train_runtime": 32.7775,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 335.718,
16
+ "train_steps_per_second": 7.048
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_42/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.821078431372549,
4
+ "eval_combined_score": 0.8452440457399417,
5
+ "eval_f1": 0.8694096601073346,
6
+ "eval_loss": 0.39012983441352844,
7
+ "eval_runtime": 1.2955,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 314.927,
10
+ "eval_steps_per_second": 3.859
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_42/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 42 --output_dir result_ablation_mbert/mrpc/mBERT/attention/seed_42 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy attention --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_42/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 630624795082152.0,
4
+ "train_loss": 0.38344859509241014,
5
+ "train_runtime": 32.7775,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 335.718,
8
+ "train_steps_per_second": 7.048
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_42/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 1.8919161558151245,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6274,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 3.552095890045166,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5334,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 13.546927452087402,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.4812,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.8186274509803921,
35
+ "eval_combined_score": 0.8446284108048814,
36
+ "eval_f1": 0.8706293706293706,
37
+ "eval_loss": 0.3727538287639618,
38
+ "eval_runtime": 1.8977,
39
+ "eval_samples_per_second": 215.002,
40
+ "eval_steps_per_second": 2.635,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 6.742566108703613,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.3793,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 4.569272994995117,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.3718,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 6.266359806060791,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3448,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8259803921568627,
67
+ "eval_combined_score": 0.8499351339114687,
68
+ "eval_f1": 0.8738898756660746,
69
+ "eval_loss": 0.35563987493515015,
70
+ "eval_runtime": 1.3779,
71
+ "eval_samples_per_second": 296.106,
72
+ "eval_steps_per_second": 3.629,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 3.569977283477783,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2726,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 8.519720077514648,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2367,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 7.060443878173828,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2367,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.821078431372549,
99
+ "eval_combined_score": 0.8452440457399417,
100
+ "eval_f1": 0.8694096601073346,
101
+ "eval_loss": 0.39012983441352844,
102
+ "eval_runtime": 1.2444,
103
+ "eval_samples_per_second": 327.87,
104
+ "eval_steps_per_second": 4.018,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 630624795082152.0,
111
+ "train_loss": 0.38344859509241014,
112
+ "train_runtime": 32.7775,
113
+ "train_samples_per_second": 335.718,
114
+ "train_steps_per_second": 7.048
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 630624795082152.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_43/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8333333333333334,
4
+ "eval_combined_score": 0.8543956043956045,
5
+ "eval_f1": 0.8754578754578755,
6
+ "eval_loss": 0.33410194516181946,
7
+ "eval_runtime": 2.021,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 201.876,
10
+ "eval_steps_per_second": 2.474,
11
+ "total_flos": 628605196579320.0,
12
+ "train_loss": 0.39260981506083437,
13
+ "train_runtime": 28.6766,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 383.728,
16
+ "train_steps_per_second": 8.055
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_43/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8333333333333334,
4
+ "eval_combined_score": 0.8543956043956045,
5
+ "eval_f1": 0.8754578754578755,
6
+ "eval_loss": 0.33410194516181946,
7
+ "eval_runtime": 2.021,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 201.876,
10
+ "eval_steps_per_second": 2.474
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_43/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 43 --output_dir result_ablation_mbert/mrpc/mBERT/attention/seed_43 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy attention --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_43/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 628605196579320.0,
4
+ "train_loss": 0.39260981506083437,
5
+ "train_runtime": 28.6766,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 383.728,
8
+ "train_steps_per_second": 8.055
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_43/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 3.246776819229126,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6006,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 4.267175197601318,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5232,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 2.849297285079956,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.4914,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.7965686274509803,
35
+ "eval_combined_score": 0.8318843137254901,
36
+ "eval_f1": 0.8672,
37
+ "eval_loss": 0.407106876373291,
38
+ "eval_runtime": 1.3234,
39
+ "eval_samples_per_second": 308.285,
40
+ "eval_steps_per_second": 3.778,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 11.595773696899414,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.3953,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 4.524789810180664,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.4084,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 12.777288436889648,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3733,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8284313725490197,
67
+ "eval_combined_score": 0.8486726151134611,
68
+ "eval_f1": 0.8689138576779026,
69
+ "eval_loss": 0.35035502910614014,
70
+ "eval_runtime": 1.5875,
71
+ "eval_samples_per_second": 257.009,
72
+ "eval_steps_per_second": 3.15,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 5.481242656707764,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2687,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 6.9631805419921875,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2599,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 13.768798828125,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2515,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8333333333333334,
99
+ "eval_combined_score": 0.8543956043956045,
100
+ "eval_f1": 0.8754578754578755,
101
+ "eval_loss": 0.33410194516181946,
102
+ "eval_runtime": 1.9704,
103
+ "eval_samples_per_second": 207.065,
104
+ "eval_steps_per_second": 2.538,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 628605196579320.0,
111
+ "train_loss": 0.39260981506083437,
112
+ "train_runtime": 28.6766,
113
+ "train_samples_per_second": 383.728,
114
+ "train_steps_per_second": 8.055
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 628605196579320.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_44/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8578431372549019,
4
+ "eval_combined_score": 0.8773201451399064,
5
+ "eval_f1": 0.896797153024911,
6
+ "eval_loss": 0.3298549950122833,
7
+ "eval_runtime": 2.1403,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 190.628,
10
+ "eval_steps_per_second": 2.336,
11
+ "total_flos": 629532394664976.0,
12
+ "train_loss": 0.373855785890059,
13
+ "train_runtime": 36.2759,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 303.342,
16
+ "train_steps_per_second": 6.368
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_44/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8578431372549019,
4
+ "eval_combined_score": 0.8773201451399064,
5
+ "eval_f1": 0.896797153024911,
6
+ "eval_loss": 0.3298549950122833,
7
+ "eval_runtime": 2.1403,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 190.628,
10
+ "eval_steps_per_second": 2.336
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_44/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 44 --output_dir result_ablation_mbert/mrpc/mBERT/attention/seed_44 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy attention --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_44/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 629532394664976.0,
4
+ "train_loss": 0.373855785890059,
5
+ "train_runtime": 36.2759,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 303.342,
8
+ "train_steps_per_second": 6.368
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/attention/seed_44/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 2.1300196647644043,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.5958,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 3.123434543609619,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5298,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 5.821596145629883,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.4577,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.803921568627451,
35
+ "eval_combined_score": 0.8216394991731633,
36
+ "eval_f1": 0.8393574297188755,
37
+ "eval_loss": 0.40502360463142395,
38
+ "eval_runtime": 1.9812,
39
+ "eval_samples_per_second": 205.934,
40
+ "eval_steps_per_second": 2.524,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 5.587197303771973,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.3732,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 3.907088279724121,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.3712,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 4.280189037322998,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3615,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8602941176470589,
67
+ "eval_combined_score": 0.8795253891965312,
68
+ "eval_f1": 0.8987566607460036,
69
+ "eval_loss": 0.31799736618995667,
70
+ "eval_runtime": 1.881,
71
+ "eval_samples_per_second": 216.9,
72
+ "eval_steps_per_second": 2.658,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 6.380615234375,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2526,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 6.170959949493408,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2355,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 3.874918222427368,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2247,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8578431372549019,
99
+ "eval_combined_score": 0.8773201451399064,
100
+ "eval_f1": 0.896797153024911,
101
+ "eval_loss": 0.3298549950122833,
102
+ "eval_runtime": 2.1261,
103
+ "eval_samples_per_second": 191.899,
104
+ "eval_steps_per_second": 2.352,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 629532394664976.0,
111
+ "train_loss": 0.373855785890059,
112
+ "train_runtime": 36.2759,
113
+ "train_samples_per_second": 303.342,
114
+ "train_steps_per_second": 6.368
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 629532394664976.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_42/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8284313725490197,
4
+ "eval_combined_score": 0.8501131221719458,
5
+ "eval_f1": 0.8717948717948718,
6
+ "eval_loss": 0.3741132616996765,
7
+ "eval_runtime": 1.9516,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 209.057,
10
+ "eval_steps_per_second": 2.562,
11
+ "total_flos": 630619158933504.0,
12
+ "train_loss": 0.3877318664030595,
13
+ "train_runtime": 34.8202,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 316.024,
16
+ "train_steps_per_second": 6.634
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_42/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8284313725490197,
4
+ "eval_combined_score": 0.8501131221719458,
5
+ "eval_f1": 0.8717948717948718,
6
+ "eval_loss": 0.3741132616996765,
7
+ "eval_runtime": 1.9516,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 209.057,
10
+ "eval_steps_per_second": 2.562
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_42/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 42 --output_dir result_ablation_mbert/mrpc/mBERT/cls/seed_42 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy cls --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_42/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 630619158933504.0,
4
+ "train_loss": 0.3877318664030595,
5
+ "train_runtime": 34.8202,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 316.024,
8
+ "train_steps_per_second": 6.634
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/cls/seed_42/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 5.96425199508667,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6056,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 6.376526832580566,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5115,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 3.437178611755371,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.5137,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.8186274509803921,
35
+ "eval_combined_score": 0.8378851540616246,
36
+ "eval_f1": 0.8571428571428571,
37
+ "eval_loss": 0.4310764968395233,
38
+ "eval_runtime": 2.016,
39
+ "eval_samples_per_second": 202.377,
40
+ "eval_steps_per_second": 2.48,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 7.388753414154053,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.3975,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 4.554161548614502,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.3889,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 6.1189751625061035,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.347,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.821078431372549,
67
+ "eval_combined_score": 0.8433200628317625,
68
+ "eval_f1": 0.8655616942909761,
69
+ "eval_loss": 0.3410874903202057,
70
+ "eval_runtime": 1.8925,
71
+ "eval_samples_per_second": 215.583,
72
+ "eval_steps_per_second": 2.642,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 4.478530406951904,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2785,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 9.207025527954102,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2466,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 11.181907653808594,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2329,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8284313725490197,
99
+ "eval_combined_score": 0.8501131221719458,
100
+ "eval_f1": 0.8717948717948718,
101
+ "eval_loss": 0.3741132616996765,
102
+ "eval_runtime": 1.8733,
103
+ "eval_samples_per_second": 217.803,
104
+ "eval_steps_per_second": 2.669,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 630619158933504.0,
111
+ "train_loss": 0.3877318664030595,
112
+ "train_runtime": 34.8202,
113
+ "train_samples_per_second": 316.024,
114
+ "train_steps_per_second": 6.634
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 630619158933504.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }