PuxAI commited on
Commit
5ca9620
·
verified ·
1 Parent(s): 8906fde

Upload batch 9/24: mrpc/mBERT/gated_multi_branch/seed_44 ... mrpc/mBERT/hf_sequence_classifier/seed_44

Browse files
Files changed (20) hide show
  1. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_44/all_results.json +17 -0
  2. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_44/eval_results.json +11 -0
  3. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_44/run_command.txt +1 -0
  4. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_44/train_results.json +9 -0
  5. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_44/trainer_state.json +138 -0
  6. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_42/all_results.json +17 -0
  7. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_42/eval_results.json +11 -0
  8. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_42/run_command.txt +1 -0
  9. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_42/train_results.json +9 -0
  10. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_42/trainer_state.json +138 -0
  11. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_43/all_results.json +17 -0
  12. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_43/eval_results.json +11 -0
  13. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_43/run_command.txt +1 -0
  14. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_43/train_results.json +9 -0
  15. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_43/trainer_state.json +138 -0
  16. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_44/all_results.json +17 -0
  17. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_44/eval_results.json +11 -0
  18. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_44/run_command.txt +1 -0
  19. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_44/train_results.json +9 -0
  20. mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_44/trainer_state.json +138 -0
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_44/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8602941176470589,
4
+ "eval_combined_score": 0.8787957074721782,
5
+ "eval_f1": 0.8972972972972973,
6
+ "eval_loss": 0.34184572100639343,
7
+ "eval_runtime": 1.3702,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 297.757,
10
+ "eval_steps_per_second": 3.649,
11
+ "total_flos": 649699269630048.0,
12
+ "train_loss": 0.385329819344855,
13
+ "train_runtime": 33.4079,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 329.383,
16
+ "train_steps_per_second": 6.915
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_44/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8602941176470589,
4
+ "eval_combined_score": 0.8787957074721782,
5
+ "eval_f1": 0.8972972972972973,
6
+ "eval_loss": 0.34184572100639343,
7
+ "eval_runtime": 1.3702,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 297.757,
10
+ "eval_steps_per_second": 3.649
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_44/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 44 --output_dir result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_44 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save --use_mha true --pooling_strategy gated_multi_branch --n_heads 4 --head_dim 32 --classifier_hidden_dim 512 --head_dropout 0.05
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_44/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 649699269630048.0,
4
+ "train_loss": 0.385329819344855,
5
+ "train_runtime": 33.4079,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 329.383,
8
+ "train_steps_per_second": 6.915
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/gated_multi_branch/seed_44/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 1.9964197874069214,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.5994,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 2.559793710708618,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5489,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 4.578395366668701,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.4804,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.8235294117647058,
35
+ "eval_combined_score": 0.8419972640218878,
36
+ "eval_f1": 0.8604651162790697,
37
+ "eval_loss": 0.41182783246040344,
38
+ "eval_runtime": 1.83,
39
+ "eval_samples_per_second": 222.95,
40
+ "eval_steps_per_second": 2.732,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 4.026550769805908,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.3802,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 4.639058589935303,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.376,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 4.616215705871582,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3741,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8676470588235294,
67
+ "eval_combined_score": 0.8862883181441591,
68
+ "eval_f1": 0.9049295774647887,
69
+ "eval_loss": 0.3325900733470917,
70
+ "eval_runtime": 1.3292,
71
+ "eval_samples_per_second": 306.941,
72
+ "eval_steps_per_second": 3.762,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 7.209536075592041,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2708,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 7.712475299835205,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2348,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 4.1902971267700195,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2353,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8602941176470589,
99
+ "eval_combined_score": 0.8787957074721782,
100
+ "eval_f1": 0.8972972972972973,
101
+ "eval_loss": 0.34184572100639343,
102
+ "eval_runtime": 1.2953,
103
+ "eval_samples_per_second": 314.976,
104
+ "eval_steps_per_second": 3.86,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 649699269630048.0,
111
+ "train_loss": 0.385329819344855,
112
+ "train_runtime": 33.4079,
113
+ "train_samples_per_second": 329.383,
114
+ "train_steps_per_second": 6.915
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 649699269630048.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_42/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8161764705882353,
4
+ "eval_combined_score": 0.8382558330594807,
5
+ "eval_f1": 0.8603351955307262,
6
+ "eval_loss": 0.37590235471725464,
7
+ "eval_runtime": 1.8425,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 221.44,
10
+ "eval_steps_per_second": 2.714,
11
+ "total_flos": 627731589210960.0,
12
+ "train_loss": 0.44336734757278906,
13
+ "train_runtime": 41.466,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 265.374,
16
+ "train_steps_per_second": 5.571
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_42/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8161764705882353,
4
+ "eval_combined_score": 0.8382558330594807,
5
+ "eval_f1": 0.8603351955307262,
6
+ "eval_loss": 0.37590235471725464,
7
+ "eval_runtime": 1.8425,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 221.44,
10
+ "eval_steps_per_second": 2.714
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_42/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 42 --output_dir result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_42 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_42/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 627731589210960.0,
4
+ "train_loss": 0.44336734757278906,
5
+ "train_runtime": 41.466,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 265.374,
8
+ "train_steps_per_second": 5.571
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_42/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 2.0890960693359375,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6061,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 4.14626407623291,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5293,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 3.3394346237182617,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.539,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.7794117647058824,
35
+ "eval_combined_score": 0.8115808823529411,
36
+ "eval_f1": 0.84375,
37
+ "eval_loss": 0.4522019922733307,
38
+ "eval_runtime": 1.7874,
39
+ "eval_samples_per_second": 228.259,
40
+ "eval_steps_per_second": 2.797,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 5.786990165710449,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.4253,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 11.188650131225586,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.4634,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 5.304947376251221,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.4306,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8014705882352942,
67
+ "eval_combined_score": 0.8230001693575704,
68
+ "eval_f1": 0.8445297504798465,
69
+ "eval_loss": 0.4265172481536865,
70
+ "eval_runtime": 1.8415,
71
+ "eval_samples_per_second": 221.554,
72
+ "eval_steps_per_second": 2.715,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 3.4806904792785645,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.379,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 7.440636157989502,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.3246,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 8.39614200592041,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.3212,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8161764705882353,
99
+ "eval_combined_score": 0.8382558330594807,
100
+ "eval_f1": 0.8603351955307262,
101
+ "eval_loss": 0.37590235471725464,
102
+ "eval_runtime": 1.717,
103
+ "eval_samples_per_second": 237.628,
104
+ "eval_steps_per_second": 2.912,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 627731589210960.0,
111
+ "train_loss": 0.44336734757278906,
112
+ "train_runtime": 41.466,
113
+ "train_samples_per_second": 265.374,
114
+ "train_steps_per_second": 5.571
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 627731589210960.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_43/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8382352941176471,
4
+ "eval_combined_score": 0.859977862112587,
5
+ "eval_f1": 0.8817204301075269,
6
+ "eval_loss": 0.3466010093688965,
7
+ "eval_runtime": 1.5932,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 256.09,
10
+ "eval_steps_per_second": 3.138,
11
+ "total_flos": 625721256303600.0,
12
+ "train_loss": 0.41218561940378956,
13
+ "train_runtime": 20.9554,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 525.114,
16
+ "train_steps_per_second": 11.023
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_43/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8382352941176471,
4
+ "eval_combined_score": 0.859977862112587,
5
+ "eval_f1": 0.8817204301075269,
6
+ "eval_loss": 0.3466010093688965,
7
+ "eval_runtime": 1.5932,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 256.09,
10
+ "eval_steps_per_second": 3.138
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_43/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 43 --output_dir result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_43 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_43/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 625721256303600.0,
4
+ "train_loss": 0.41218561940378956,
5
+ "train_runtime": 20.9554,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 525.114,
8
+ "train_steps_per_second": 11.023
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_43/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 3.668508291244507,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.586,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 5.74367618560791,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5549,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 4.881658554077148,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.5017,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.7941176470588235,
35
+ "eval_combined_score": 0.8201357466063348,
36
+ "eval_f1": 0.8461538461538461,
37
+ "eval_loss": 0.42805391550064087,
38
+ "eval_runtime": 1.3728,
39
+ "eval_samples_per_second": 297.193,
40
+ "eval_steps_per_second": 3.642,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 11.543705940246582,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.4403,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 5.57627010345459,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.395,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 10.026427268981934,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.3935,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8553921568627451,
67
+ "eval_combined_score": 0.8747337804062378,
68
+ "eval_f1": 0.8940754039497307,
69
+ "eval_loss": 0.34582728147506714,
70
+ "eval_runtime": 1.4011,
71
+ "eval_samples_per_second": 291.21,
72
+ "eval_steps_per_second": 3.569,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 9.870122909545898,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.2911,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 5.679322719573975,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.3041,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 11.193693161010742,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2776,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8382352941176471,
99
+ "eval_combined_score": 0.859977862112587,
100
+ "eval_f1": 0.8817204301075269,
101
+ "eval_loss": 0.3466010093688965,
102
+ "eval_runtime": 1.397,
103
+ "eval_samples_per_second": 292.055,
104
+ "eval_steps_per_second": 3.579,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 625721256303600.0,
111
+ "train_loss": 0.41218561940378956,
112
+ "train_runtime": 20.9554,
113
+ "train_samples_per_second": 525.114,
114
+ "train_steps_per_second": 11.023
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 625721256303600.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_44/all_results.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8382352941176471,
4
+ "eval_combined_score": 0.8580065359477125,
5
+ "eval_f1": 0.8777777777777778,
6
+ "eval_loss": 0.35651159286499023,
7
+ "eval_runtime": 2.0928,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 194.951,
10
+ "eval_steps_per_second": 2.389,
11
+ "total_flos": 626644200552480.0,
12
+ "train_loss": 0.4211170962362578,
13
+ "train_runtime": 29.053,
14
+ "train_samples": 3668,
15
+ "train_samples_per_second": 378.756,
16
+ "train_steps_per_second": 7.951
17
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_44/eval_results.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "eval_accuracy": 0.8382352941176471,
4
+ "eval_combined_score": 0.8580065359477125,
5
+ "eval_f1": 0.8777777777777778,
6
+ "eval_loss": 0.35651159286499023,
7
+ "eval_runtime": 2.0928,
8
+ "eval_samples": 408,
9
+ "eval_samples_per_second": 194.951,
10
+ "eval_steps_per_second": 2.389
11
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_44/run_command.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ /usr/local/bin/python /workspace/run_glue_MHA_gated.py --model_name_or_path bert-base-multilingual-cased --dataset_name tmnam20/ViGLUE --task_name mrpc --max_seq_length 128 --do_train --do_eval --evaluation_strategy epoch --save_strategy no --logging_strategy steps --logging_steps 25 --report_to none --num_train_epochs 3 --learning_rate 3e-05 --per_device_train_batch_size 48 --per_device_eval_batch_size 96 --gradient_accumulation_steps 1 --dataloader_num_workers 1 --seed 44 --output_dir result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_44 --overwrite_output_dir --trust_remote_code true --bf16 --tf32 true --skip_model_save
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_44/train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 3.0,
3
+ "total_flos": 626644200552480.0,
4
+ "train_loss": 0.4211170962362578,
5
+ "train_runtime": 29.053,
6
+ "train_samples": 3668,
7
+ "train_samples_per_second": 378.756,
8
+ "train_steps_per_second": 7.951
9
+ }
mbert_rtx6000_metrics/result_ablation_mbert/mrpc/mBERT/hf_sequence_classifier/seed_44/trainer_state.json ADDED
@@ -0,0 +1,138 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 500,
6
+ "global_step": 231,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.3246753246753247,
13
+ "grad_norm": 2.104104995727539,
14
+ "learning_rate": 2.6753246753246755e-05,
15
+ "loss": 0.6058,
16
+ "step": 25
17
+ },
18
+ {
19
+ "epoch": 0.6493506493506493,
20
+ "grad_norm": 3.205981969833374,
21
+ "learning_rate": 2.350649350649351e-05,
22
+ "loss": 0.5493,
23
+ "step": 50
24
+ },
25
+ {
26
+ "epoch": 0.974025974025974,
27
+ "grad_norm": 6.8437323570251465,
28
+ "learning_rate": 2.025974025974026e-05,
29
+ "loss": 0.5066,
30
+ "step": 75
31
+ },
32
+ {
33
+ "epoch": 1.0,
34
+ "eval_accuracy": 0.7818627450980392,
35
+ "eval_combined_score": 0.8031601693932011,
36
+ "eval_f1": 0.8244575936883629,
37
+ "eval_loss": 0.4698929190635681,
38
+ "eval_runtime": 1.4776,
39
+ "eval_samples_per_second": 276.116,
40
+ "eval_steps_per_second": 3.384,
41
+ "step": 77
42
+ },
43
+ {
44
+ "epoch": 1.2987012987012987,
45
+ "grad_norm": 6.096251487731934,
46
+ "learning_rate": 1.7012987012987013e-05,
47
+ "loss": 0.4229,
48
+ "step": 100
49
+ },
50
+ {
51
+ "epoch": 1.6233766233766234,
52
+ "grad_norm": 5.171522617340088,
53
+ "learning_rate": 1.3766233766233767e-05,
54
+ "loss": 0.409,
55
+ "step": 125
56
+ },
57
+ {
58
+ "epoch": 1.948051948051948,
59
+ "grad_norm": 4.848453521728516,
60
+ "learning_rate": 1.051948051948052e-05,
61
+ "loss": 0.4078,
62
+ "step": 150
63
+ },
64
+ {
65
+ "epoch": 2.0,
66
+ "eval_accuracy": 0.8235294117647058,
67
+ "eval_combined_score": 0.8453440416757109,
68
+ "eval_f1": 0.8671586715867159,
69
+ "eval_loss": 0.36354437470436096,
70
+ "eval_runtime": 1.8924,
71
+ "eval_samples_per_second": 215.603,
72
+ "eval_steps_per_second": 2.642,
73
+ "step": 154
74
+ },
75
+ {
76
+ "epoch": 2.2727272727272725,
77
+ "grad_norm": 10.848043441772461,
78
+ "learning_rate": 7.272727272727273e-06,
79
+ "loss": 0.3305,
80
+ "step": 175
81
+ },
82
+ {
83
+ "epoch": 2.5974025974025974,
84
+ "grad_norm": 6.4878692626953125,
85
+ "learning_rate": 4.025974025974026e-06,
86
+ "loss": 0.2938,
87
+ "step": 200
88
+ },
89
+ {
90
+ "epoch": 2.9220779220779223,
91
+ "grad_norm": 4.981741905212402,
92
+ "learning_rate": 7.792207792207793e-07,
93
+ "loss": 0.2868,
94
+ "step": 225
95
+ },
96
+ {
97
+ "epoch": 3.0,
98
+ "eval_accuracy": 0.8382352941176471,
99
+ "eval_combined_score": 0.8580065359477125,
100
+ "eval_f1": 0.8777777777777778,
101
+ "eval_loss": 0.35651159286499023,
102
+ "eval_runtime": 2.1444,
103
+ "eval_samples_per_second": 190.262,
104
+ "eval_steps_per_second": 2.332,
105
+ "step": 231
106
+ },
107
+ {
108
+ "epoch": 3.0,
109
+ "step": 231,
110
+ "total_flos": 626644200552480.0,
111
+ "train_loss": 0.4211170962362578,
112
+ "train_runtime": 29.053,
113
+ "train_samples_per_second": 378.756,
114
+ "train_steps_per_second": 7.951
115
+ }
116
+ ],
117
+ "logging_steps": 25,
118
+ "max_steps": 231,
119
+ "num_input_tokens_seen": 0,
120
+ "num_train_epochs": 3,
121
+ "save_steps": 500,
122
+ "stateful_callbacks": {
123
+ "TrainerControl": {
124
+ "args": {
125
+ "should_epoch_stop": false,
126
+ "should_evaluate": false,
127
+ "should_log": false,
128
+ "should_save": false,
129
+ "should_training_stop": false
130
+ },
131
+ "attributes": {}
132
+ }
133
+ },
134
+ "total_flos": 626644200552480.0,
135
+ "train_batch_size": 48,
136
+ "trial_name": null,
137
+ "trial_params": null
138
+ }