PuxAI commited on
Commit
9816959
·
verified ·
1 Parent(s): c4fb64c

Upload batch 12/24: mrpc/mBERT/mha_attention/seed_44 ... mrpc/mBERT/multi_branch_average/seed_44

Browse files
Files changed (20) hide show
  1. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mha_attention/seed_44/all_results.json +17 -0
  2. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mha_attention/seed_44/eval_results.json +11 -0
  3. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mha_attention/seed_44/run_command.txt +1 -0
  4. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mha_attention/seed_44/train_results.json +9 -0
  5. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mha_attention/seed_44/trainer_state.json +138 -0
  6. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_42/all_results.json +17 -0
  7. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_42/eval_results.json +11 -0
  8. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_42/run_command.txt +1 -0
  9. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_42/train_results.json +9 -0
  10. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_42/trainer_state.json +138 -0
  11. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_43/all_results.json +17 -0
  12. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_43/eval_results.json +11 -0
  13. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_43/run_command.txt +1 -0
  14. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_43/train_results.json +9 -0
  15. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_43/trainer_state.json +138 -0
  16. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_44/all_results.json +17 -0
  17. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_44/eval_results.json +11 -0
  18. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_44/run_command.txt +1 -0
  19. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_44/train_results.json +9 -0
  20. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_44/trainer_state.json +138 -0
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mha_attention/seed_44/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8578431372549019,
4
+ "eval_combined_score": 0.8767632952461559,
5
+ "eval_f1": 0.89568345323741,
6
+ "eval_loss": 0.34328851103782654,
7
+ "eval_runtime": 1.3366,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 305.257,
10
+ "eval_steps_per_second": 3.741,
11
+ "total_flos": 632409357956112.0,
12
+ "train_loss": 0.38678704608570447,
13
+ "train_runtime": 34.893,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 315.364,
16
+ "train_steps_per_second": 6.62
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mha_attention/seed_44/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8578431372549019,
4
+ "eval_combined_score": 0.8767632952461559,
5
+ "eval_f1": 0.89568345323741,
6
+ "eval_loss": 0.34328851103782654,
7
+ "eval_runtime": 1.3366,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 305.257,
10
+ "eval_steps_per_second": 3.741
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mha_attention/seed_44/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 44 --output_dir result_ablation_mbert/mrpc/mBERT/mha_attention/seed_44 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy mha_attention --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mha_attention/seed_44/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 632409357956112.0,
4
+ "train_loss": 0.38678704608570447,
5
+ "train_runtime": 34.893,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 315.364,
8
+ "train_steps_per_second": 6.62
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/mha_attention/seed_44/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 2.5029401779174805,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6023,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 2.046332836151123,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.532,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 3.2743406295776367,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.4732,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.7818627450980392,
35
+ "eval_combined_score": 0.8003000079869015,
36
+ "eval_f1": 0.8187372708757638,
37
+ "eval_loss": 0.4533577859401703,
38
+ "eval_runtime": 1.8731,
39
+ "eval_samples_per_second": 217.821,
40
+ "eval_steps_per_second": 2.669,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 3.9565742015838623,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.3855,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 3.86584734916687,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.3788,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 4.910215377807617,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.388,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8357843137254902,
67
+ "eval_combined_score": 0.858600121464515,
68
+ "eval_f1": 0.8814159292035398,
69
+ "eval_loss": 0.3557942807674408,
70
+ "eval_runtime": 1.8551,
71
+ "eval_samples_per_second": 219.935,
72
+ "eval_steps_per_second": 2.695,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 5.348351955413818,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2601,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 8.830328941345215,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2558,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 3.9247565269470215,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2408,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8578431372549019,
99
+ "eval_combined_score": 0.8767632952461559,
100
+ "eval_f1": 0.89568345323741,
101
+ "eval_loss": 0.34328851103782654,
102
+ "eval_runtime": 1.2657,
103
+ "eval_samples_per_second": 322.359,
104
+ "eval_steps_per_second": 3.95,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 632409357956112.0,
111
+ "train_loss": 0.38678704608570447,
112
+ "train_runtime": 34.893,
113
+ "train_samples_per_second": 315.364,
114
+ "train_steps_per_second": 6.62
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 632409357956112.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_42/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8504901960784313,
4
+ "eval_combined_score": 0.8714532109139952,
5
+ "eval_f1": 0.892416225749559,
6
+ "eval_loss": 0.3461981415748596,
7
+ "eval_runtime": 1.9053,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 214.136,
10
+ "eval_steps_per_second": 2.624,
11
+ "total_flos": 650809756309752.0,
12
+ "train_loss": 0.38643745581309,
13
+ "train_runtime": 27.189,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 404.722,
16
+ "train_steps_per_second": 8.496
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_42/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8504901960784313,
4
+ "eval_combined_score": 0.8714532109139952,
5
+ "eval_f1": 0.892416225749559,
6
+ "eval_loss": 0.3461981415748596,
7
+ "eval_runtime": 1.9053,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 214.136,
10
+ "eval_steps_per_second": 2.624
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_42/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 42 --output_dir result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_42 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy multi_branch_average --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_42/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 650809756309752.0,
4
+ "train_loss": 0.38643745581309,
5
+ "train_runtime": 27.189,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 404.722,
8
+ "train_steps_per_second": 8.496
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_42/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 3.312774181365967,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.612,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 7.789833068847656,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5163,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 4.037544250488281,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.5178,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.7696078431372549,
35
+ "eval_combined_score": 0.7876964835520985,
36
+ "eval_f1": 0.8057851239669421,
37
+ "eval_loss": 0.4581141471862793,
38
+ "eval_runtime": 1.6688,
39
+ "eval_samples_per_second": 244.493,
40
+ "eval_steps_per_second": 2.996,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 5.829493522644043,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.4002,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 5.771215438842773,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.3759,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 10.886384963989258,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3424,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8627450980392157,
67
+ "eval_combined_score": 0.8820767743717206,
68
+ "eval_f1": 0.9014084507042254,
69
+ "eval_loss": 0.3224419951438904,
70
+ "eval_runtime": 1.2952,
71
+ "eval_samples_per_second": 315.006,
72
+ "eval_steps_per_second": 3.86,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 5.9191155433654785,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2623,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 11.66323184967041,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2459,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 7.454559803009033,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2329,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8504901960784313,
99
+ "eval_combined_score": 0.8714532109139952,
100
+ "eval_f1": 0.892416225749559,
101
+ "eval_loss": 0.3461981415748596,
102
+ "eval_runtime": 1.5564,
103
+ "eval_samples_per_second": 262.141,
104
+ "eval_steps_per_second": 3.213,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 650809756309752.0,
111
+ "train_loss": 0.38643745581309,
112
+ "train_runtime": 27.189,
113
+ "train_samples_per_second": 404.722,
114
+ "train_steps_per_second": 8.496
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 650809756309752.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_43/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8455882352941176,
4
+ "eval_combined_score": 0.8670419052576783,
5
+ "eval_f1": 0.8884955752212389,
6
+ "eval_loss": 0.35154372453689575,
7
+ "eval_runtime": 1.8306,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 222.879,
10
+ "eval_steps_per_second": 2.731,
11
+ "total_flos": 648725514745320.0,
12
+ "train_loss": 0.4033502381601375,
13
+ "train_runtime": 38.279,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 287.468,
16
+ "train_steps_per_second": 6.035
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_43/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8455882352941176,
4
+ "eval_combined_score": 0.8670419052576783,
5
+ "eval_f1": 0.8884955752212389,
6
+ "eval_loss": 0.35154372453689575,
7
+ "eval_runtime": 1.8306,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 222.879,
10
+ "eval_steps_per_second": 2.731
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_43/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 43 --output_dir result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_43 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy multi_branch_average --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_43/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 648725514745320.0,
4
+ "train_loss": 0.4033502381601375,
5
+ "train_runtime": 38.279,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 287.468,
8
+ "train_steps_per_second": 6.035
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_43/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 2.91154408454895,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6178,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 4.3118157386779785,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5435,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 5.843005180358887,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.5119,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.8063725490196079,
35
+ "eval_combined_score": 0.8374624808325992,
36
+ "eval_f1": 0.8685524126455907,
37
+ "eval_loss": 0.435122013092041,
38
+ "eval_runtime": 1.7876,
39
+ "eval_samples_per_second": 228.24,
40
+ "eval_steps_per_second": 2.797,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 6.603716850280762,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.4224,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 2.9754514694213867,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.4026,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 10.035341262817383,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3765,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8333333333333334,
67
+ "eval_combined_score": 0.8546228710462287,
68
+ "eval_f1": 0.8759124087591241,
69
+ "eval_loss": 0.34409093856811523,
70
+ "eval_runtime": 1.6765,
71
+ "eval_samples_per_second": 243.366,
72
+ "eval_steps_per_second": 2.982,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 5.992510795593262,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2721,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 6.607265949249268,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2613,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 10.01749324798584,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2655,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8455882352941176,
99
+ "eval_combined_score": 0.8670419052576783,
100
+ "eval_f1": 0.8884955752212389,
101
+ "eval_loss": 0.35154372453689575,
102
+ "eval_runtime": 2.0795,
103
+ "eval_samples_per_second": 196.205,
104
+ "eval_steps_per_second": 2.404,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 648725514745320.0,
111
+ "train_loss": 0.4033502381601375,
112
+ "train_runtime": 38.279,
113
+ "train_samples_per_second": 287.468,
114
+ "train_steps_per_second": 6.035
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 648725514745320.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_44/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8602941176470589,
4
+ "eval_combined_score": 0.878422920892495,
5
+ "eval_f1": 0.896551724137931,
6
+ "eval_loss": 0.33914050459861755,
7
+ "eval_runtime": 1.9691,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 207.202,
10
+ "eval_steps_per_second": 2.539,
11
+ "total_flos": 649682390473776.0,
12
+ "train_loss": 0.39075296472161364,
13
+ "train_runtime": 39.956,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 275.403,
16
+ "train_steps_per_second": 5.781
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_44/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8602941176470589,
4
+ "eval_combined_score": 0.878422920892495,
5
+ "eval_f1": 0.896551724137931,
6
+ "eval_loss": 0.33914050459861755,
7
+ "eval_runtime": 1.9691,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 207.202,
10
+ "eval_steps_per_second": 2.539
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_44/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 44 --output_dir result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_44 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy multi_branch_average --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_44/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 649682390473776.0,
4
+ "train_loss": 0.39075296472161364,
5
+ "train_runtime": 39.956,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 275.403,
8
+ "train_steps_per_second": 5.781
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/multi_branch_average/seed_44/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 2.525108575820923,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6028,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 2.730511426925659,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.538,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 4.872249603271484,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.4702,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.7769607843137255,
35
+ "eval_combined_score": 0.7950512340459798,
36
+ "eval_f1": 0.813141683778234,
37
+ "eval_loss": 0.4498041272163391,
38
+ "eval_runtime": 2.0371,
39
+ "eval_samples_per_second": 200.281,
40
+ "eval_steps_per_second": 2.454,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 3.917067527770996,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.3866,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 3.84232759475708,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.3887,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 4.048624515533447,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3842,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8455882352941176,
67
+ "eval_combined_score": 0.8662411553490337,
68
+ "eval_f1": 0.8868940754039497,
69
+ "eval_loss": 0.33782169222831726,
70
+ "eval_runtime": 2.1985,
71
+ "eval_samples_per_second": 185.577,
72
+ "eval_steps_per_second": 2.274,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 5.455221652984619,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2804,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 8.960445404052734,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2439,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 4.210287570953369,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.256,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8602941176470589,
99
+ "eval_combined_score": 0.878422920892495,
100
+ "eval_f1": 0.896551724137931,
101
+ "eval_loss": 0.33914050459861755,
102
+ "eval_runtime": 1.8302,
103
+ "eval_samples_per_second": 222.925,
104
+ "eval_steps_per_second": 2.732,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 649682390473776.0,
111
+ "train_loss": 0.39075296472161364,
112
+ "train_runtime": 39.956,
113
+ "train_samples_per_second": 275.403,
114
+ "train_steps_per_second": 5.781
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 649682390473776.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }