davidshina2404 commited on
Commit
77fb049
·
verified ·
1 Parent(s): 6f27803

Upload 7 files

Browse files
Files changed (7) hide show
  1. config.json +120 -0
  2. model.safetensors +3 -0
  3. rng_state.pth +3 -0
  4. scaler.pt +3 -0
  5. scheduler.pt +3 -0
  6. trainer_state.json +2610 -0
  7. training_args.bin +3 -0
config.json ADDED
@@ -0,0 +1,120 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "SegformerForSemanticSegmentation"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.0,
6
+ "classifier_dropout_prob": 0.1,
7
+ "decoder_hidden_size": 768,
8
+ "depths": [
9
+ 3,
10
+ 4,
11
+ 6,
12
+ 3
13
+ ],
14
+ "downsampling_rates": [
15
+ 1,
16
+ 4,
17
+ 8,
18
+ 16
19
+ ],
20
+ "drop_path_rate": 0.1,
21
+ "dtype": "float32",
22
+ "hidden_act": "gelu",
23
+ "hidden_dropout_prob": 0.0,
24
+ "hidden_sizes": [
25
+ 64,
26
+ 128,
27
+ 320,
28
+ 512
29
+ ],
30
+ "id2label": {
31
+ "0": "background",
32
+ "1": "shirt, blouse",
33
+ "2": "top, t-shirt, sweatshirt",
34
+ "3": "sweater",
35
+ "4": "cardigan",
36
+ "5": "jacket",
37
+ "6": "vest",
38
+ "7": "pants",
39
+ "8": "shorts",
40
+ "9": "skirt",
41
+ "10": "coat",
42
+ "11": "dress",
43
+ "12": "glasses",
44
+ "13": "hat",
45
+ "14": "tie",
46
+ "15": "glove",
47
+ "16": "watch",
48
+ "17": "belt",
49
+ "18": "tights, stockings",
50
+ "19": "sock",
51
+ "20": "shoe",
52
+ "21": "bag",
53
+ "22": "scarf"
54
+ },
55
+ "image_size": 224,
56
+ "initializer_range": 0.02,
57
+ "label2id": {
58
+ "background": 0,
59
+ "bag": 21,
60
+ "belt": 17,
61
+ "cardigan": 4,
62
+ "coat": 10,
63
+ "dress": 11,
64
+ "glasses": 12,
65
+ "glove": 15,
66
+ "hat": 13,
67
+ "jacket": 5,
68
+ "pants": 7,
69
+ "scarf": 22,
70
+ "shirt, blouse": 1,
71
+ "shoe": 20,
72
+ "shorts": 8,
73
+ "skirt": 9,
74
+ "sock": 19,
75
+ "sweater": 3,
76
+ "tie": 14,
77
+ "tights, stockings": 18,
78
+ "top, t-shirt, sweatshirt": 2,
79
+ "vest": 6,
80
+ "watch": 16
81
+ },
82
+ "layer_norm_eps": 1e-06,
83
+ "mlp_ratios": [
84
+ 4,
85
+ 4,
86
+ 4,
87
+ 4
88
+ ],
89
+ "model_type": "segformer",
90
+ "num_attention_heads": [
91
+ 1,
92
+ 2,
93
+ 5,
94
+ 8
95
+ ],
96
+ "num_channels": 3,
97
+ "num_encoder_blocks": 4,
98
+ "patch_sizes": [
99
+ 7,
100
+ 3,
101
+ 3,
102
+ 3
103
+ ],
104
+ "reshape_last_stage": true,
105
+ "semantic_loss_ignore_index": 255,
106
+ "sr_ratios": [
107
+ 8,
108
+ 4,
109
+ 2,
110
+ 1
111
+ ],
112
+ "strides": [
113
+ 4,
114
+ 2,
115
+ 2,
116
+ 2
117
+ ],
118
+ "transformers_version": "5.0.0",
119
+ "use_cache": false
120
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d621658b537511c01f033bfa911027fd5996acd6704c1cf8678aa466d7e9b076
3
+ size 109508620
rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cbdd6a8933cbfd69bf19d929214ee151a1c09d43a4a2bae6f253cffcd638b67c
3
+ size 14645
scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:22632e75595ab0de15567011a5b81255ea87b6ab8abcb24422372dfe2b463975
3
+ size 1383
scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0d03d8b37f0a8d6909b2615f9dd1626e10dbd2bf960298ae3245c58abe575d55
3
+ size 1465
trainer_state.json ADDED
@@ -0,0 +1,2610 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 4.930486462689853,
6
+ "eval_steps": 500,
7
+ "global_step": 28000,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.017609509134932862,
14
+ "grad_norm": 48.91790771484375,
15
+ "learning_rate": 5.989540412044374e-05,
16
+ "loss": 9.243912963867187,
17
+ "step": 100
18
+ },
19
+ {
20
+ "epoch": 0.035219018269865725,
21
+ "grad_norm": 10.053231239318848,
22
+ "learning_rate": 5.978975171685156e-05,
23
+ "loss": 3.7935104370117188,
24
+ "step": 200
25
+ },
26
+ {
27
+ "epoch": 0.05282852740479859,
28
+ "grad_norm": 10.990548133850098,
29
+ "learning_rate": 5.968409931325938e-05,
30
+ "loss": 3.084054260253906,
31
+ "step": 300
32
+ },
33
+ {
34
+ "epoch": 0.07043803653973145,
35
+ "grad_norm": 25.284229278564453,
36
+ "learning_rate": 5.9578446909667196e-05,
37
+ "loss": 2.5839889526367186,
38
+ "step": 400
39
+ },
40
+ {
41
+ "epoch": 0.08804754567466432,
42
+ "grad_norm": 19.381221771240234,
43
+ "learning_rate": 5.9472794506075014e-05,
44
+ "loss": 2.5452081298828126,
45
+ "step": 500
46
+ },
47
+ {
48
+ "epoch": 0.08804754567466432,
49
+ "eval_loss": 0.46036240458488464,
50
+ "eval_mIoU": 24.719834678855246,
51
+ "eval_mean_accuracy": 30.302184775266984,
52
+ "eval_overall_accuracy": 93.80432756432208,
53
+ "eval_runtime": 595.2093,
54
+ "eval_samples_per_second": 1.94,
55
+ "eval_steps_per_second": 0.971,
56
+ "step": 500
57
+ },
58
+ {
59
+ "epoch": 0.10565705480959718,
60
+ "grad_norm": 30.767061233520508,
61
+ "learning_rate": 5.936714210248283e-05,
62
+ "loss": 2.543914794921875,
63
+ "step": 600
64
+ },
65
+ {
66
+ "epoch": 0.12326656394453005,
67
+ "grad_norm": 12.711847305297852,
68
+ "learning_rate": 5.926148969889066e-05,
69
+ "loss": 2.555495300292969,
70
+ "step": 700
71
+ },
72
+ {
73
+ "epoch": 0.1408760730794629,
74
+ "grad_norm": 9.562529563903809,
75
+ "learning_rate": 5.915583729529847e-05,
76
+ "loss": 2.357043914794922,
77
+ "step": 800
78
+ },
79
+ {
80
+ "epoch": 0.15848558221439576,
81
+ "grad_norm": 7.863616943359375,
82
+ "learning_rate": 5.905018489170629e-05,
83
+ "loss": 2.3811045837402345,
84
+ "step": 900
85
+ },
86
+ {
87
+ "epoch": 0.17609509134932863,
88
+ "grad_norm": 19.924156188964844,
89
+ "learning_rate": 5.8944532488114105e-05,
90
+ "loss": 2.2813540649414064,
91
+ "step": 1000
92
+ },
93
+ {
94
+ "epoch": 0.17609509134932863,
95
+ "eval_loss": 0.4134902060031891,
96
+ "eval_mIoU": 28.85459800222985,
97
+ "eval_mean_accuracy": 36.7015683094026,
98
+ "eval_overall_accuracy": 94.40936266085802,
99
+ "eval_runtime": 581.5599,
100
+ "eval_samples_per_second": 1.986,
101
+ "eval_steps_per_second": 0.994,
102
+ "step": 1000
103
+ },
104
+ {
105
+ "epoch": 0.1937046004842615,
106
+ "grad_norm": 9.245338439941406,
107
+ "learning_rate": 5.883888008452192e-05,
108
+ "loss": 2.224588165283203,
109
+ "step": 1100
110
+ },
111
+ {
112
+ "epoch": 0.21131410961919436,
113
+ "grad_norm": 28.38551902770996,
114
+ "learning_rate": 5.873322768092974e-05,
115
+ "loss": 2.2024305725097655,
116
+ "step": 1200
117
+ },
118
+ {
119
+ "epoch": 0.22892361875412723,
120
+ "grad_norm": 21.654741287231445,
121
+ "learning_rate": 5.862757527733756e-05,
122
+ "loss": 2.333185577392578,
123
+ "step": 1300
124
+ },
125
+ {
126
+ "epoch": 0.2465331278890601,
127
+ "grad_norm": 22.906660079956055,
128
+ "learning_rate": 5.8521922873745385e-05,
129
+ "loss": 2.1109620666503908,
130
+ "step": 1400
131
+ },
132
+ {
133
+ "epoch": 0.26414263702399293,
134
+ "grad_norm": 19.337547302246094,
135
+ "learning_rate": 5.8416270470153196e-05,
136
+ "loss": 2.1600161743164064,
137
+ "step": 1500
138
+ },
139
+ {
140
+ "epoch": 0.26414263702399293,
141
+ "eval_loss": 0.41332295536994934,
142
+ "eval_mIoU": 30.867547066481954,
143
+ "eval_mean_accuracy": 38.46061833204942,
144
+ "eval_overall_accuracy": 94.4356427873884,
145
+ "eval_runtime": 582.6409,
146
+ "eval_samples_per_second": 1.982,
147
+ "eval_steps_per_second": 0.992,
148
+ "step": 1500
149
+ },
150
+ {
151
+ "epoch": 0.2817521461589258,
152
+ "grad_norm": 16.490278244018555,
153
+ "learning_rate": 5.831061806656102e-05,
154
+ "loss": 2.0159757995605467,
155
+ "step": 1600
156
+ },
157
+ {
158
+ "epoch": 0.29936165529385866,
159
+ "grad_norm": 17.120445251464844,
160
+ "learning_rate": 5.820496566296883e-05,
161
+ "loss": 2.0717059326171876,
162
+ "step": 1700
163
+ },
164
+ {
165
+ "epoch": 0.31697116442879153,
166
+ "grad_norm": 12.258465766906738,
167
+ "learning_rate": 5.809931325937665e-05,
168
+ "loss": 2.131772918701172,
169
+ "step": 1800
170
+ },
171
+ {
172
+ "epoch": 0.3345806735637244,
173
+ "grad_norm": 13.74216079711914,
174
+ "learning_rate": 5.799366085578447e-05,
175
+ "loss": 1.8676652526855468,
176
+ "step": 1900
177
+ },
178
+ {
179
+ "epoch": 0.35219018269865726,
180
+ "grad_norm": 25.953657150268555,
181
+ "learning_rate": 5.788800845219229e-05,
182
+ "loss": 1.9515042114257812,
183
+ "step": 2000
184
+ },
185
+ {
186
+ "epoch": 0.35219018269865726,
187
+ "eval_loss": 0.4337688982486725,
188
+ "eval_mIoU": 32.19576589621381,
189
+ "eval_mean_accuracy": 40.59080396049274,
190
+ "eval_overall_accuracy": 94.54845279842228,
191
+ "eval_runtime": 584.2063,
192
+ "eval_samples_per_second": 1.977,
193
+ "eval_steps_per_second": 0.989,
194
+ "step": 2000
195
+ },
196
+ {
197
+ "epoch": 0.3697996918335901,
198
+ "grad_norm": 19.75416374206543,
199
+ "learning_rate": 5.778235604860011e-05,
200
+ "loss": 1.784864959716797,
201
+ "step": 2100
202
+ },
203
+ {
204
+ "epoch": 0.387409200968523,
205
+ "grad_norm": 22.587085723876953,
206
+ "learning_rate": 5.767670364500792e-05,
207
+ "loss": 1.9940145874023438,
208
+ "step": 2200
209
+ },
210
+ {
211
+ "epoch": 0.40501871010345586,
212
+ "grad_norm": 35.613121032714844,
213
+ "learning_rate": 5.757105124141575e-05,
214
+ "loss": 1.9241729736328126,
215
+ "step": 2300
216
+ },
217
+ {
218
+ "epoch": 0.4226282192383887,
219
+ "grad_norm": 38.178104400634766,
220
+ "learning_rate": 5.746539883782356e-05,
221
+ "loss": 1.7019007873535157,
222
+ "step": 2400
223
+ },
224
+ {
225
+ "epoch": 0.4402377283733216,
226
+ "grad_norm": 35.151058197021484,
227
+ "learning_rate": 5.735974643423138e-05,
228
+ "loss": 1.8641450500488281,
229
+ "step": 2500
230
+ },
231
+ {
232
+ "epoch": 0.4402377283733216,
233
+ "eval_loss": 0.39942070841789246,
234
+ "eval_mIoU": 33.685957807527856,
235
+ "eval_mean_accuracy": 44.48807007726972,
236
+ "eval_overall_accuracy": 94.60921745795709,
237
+ "eval_runtime": 588.2746,
238
+ "eval_samples_per_second": 1.963,
239
+ "eval_steps_per_second": 0.983,
240
+ "step": 2500
241
+ },
242
+ {
243
+ "epoch": 0.45784723750825446,
244
+ "grad_norm": 13.256592750549316,
245
+ "learning_rate": 5.7254094030639196e-05,
246
+ "loss": 1.7548785400390625,
247
+ "step": 2600
248
+ },
249
+ {
250
+ "epoch": 0.4754567466431873,
251
+ "grad_norm": 12.395865440368652,
252
+ "learning_rate": 5.7148441627047014e-05,
253
+ "loss": 1.7571292114257813,
254
+ "step": 2700
255
+ },
256
+ {
257
+ "epoch": 0.4930662557781202,
258
+ "grad_norm": 10.11026668548584,
259
+ "learning_rate": 5.704278922345484e-05,
260
+ "loss": 1.8158778381347656,
261
+ "step": 2800
262
+ },
263
+ {
264
+ "epoch": 0.510675764913053,
265
+ "grad_norm": 37.68540954589844,
266
+ "learning_rate": 5.693713681986265e-05,
267
+ "loss": 1.95743408203125,
268
+ "step": 2900
269
+ },
270
+ {
271
+ "epoch": 0.5282852740479859,
272
+ "grad_norm": 6.611830234527588,
273
+ "learning_rate": 5.6831484416270475e-05,
274
+ "loss": 1.9499478149414062,
275
+ "step": 3000
276
+ },
277
+ {
278
+ "epoch": 0.5282852740479859,
279
+ "eval_loss": 0.3753623068332672,
280
+ "eval_mIoU": 33.48202504810993,
281
+ "eval_mean_accuracy": 42.84434388722273,
282
+ "eval_overall_accuracy": 94.69698059610474,
283
+ "eval_runtime": 592.7509,
284
+ "eval_samples_per_second": 1.949,
285
+ "eval_steps_per_second": 0.975,
286
+ "step": 3000
287
+ },
288
+ {
289
+ "epoch": 0.5458947831829187,
290
+ "grad_norm": 11.240772247314453,
291
+ "learning_rate": 5.6725832012678287e-05,
292
+ "loss": 1.9529837036132813,
293
+ "step": 3100
294
+ },
295
+ {
296
+ "epoch": 0.5635042923178516,
297
+ "grad_norm": 5.816749095916748,
298
+ "learning_rate": 5.662017960908611e-05,
299
+ "loss": 1.7379286193847656,
300
+ "step": 3200
301
+ },
302
+ {
303
+ "epoch": 0.5811138014527845,
304
+ "grad_norm": 14.43251895904541,
305
+ "learning_rate": 5.651452720549393e-05,
306
+ "loss": 1.878860626220703,
307
+ "step": 3300
308
+ },
309
+ {
310
+ "epoch": 0.5987233105877173,
311
+ "grad_norm": 17.320858001708984,
312
+ "learning_rate": 5.640887480190174e-05,
313
+ "loss": 1.7022770690917968,
314
+ "step": 3400
315
+ },
316
+ {
317
+ "epoch": 0.6163328197226502,
318
+ "grad_norm": 8.217686653137207,
319
+ "learning_rate": 5.6303222398309566e-05,
320
+ "loss": 1.7487423706054688,
321
+ "step": 3500
322
+ },
323
+ {
324
+ "epoch": 0.6163328197226502,
325
+ "eval_loss": 0.3824031949043274,
326
+ "eval_mIoU": 35.34702178902146,
327
+ "eval_mean_accuracy": 43.66437157324913,
328
+ "eval_overall_accuracy": 95.11653123995958,
329
+ "eval_runtime": 594.2993,
330
+ "eval_samples_per_second": 1.943,
331
+ "eval_steps_per_second": 0.973,
332
+ "step": 3500
333
+ },
334
+ {
335
+ "epoch": 0.6339423288575831,
336
+ "grad_norm": 8.632674217224121,
337
+ "learning_rate": 5.619756999471738e-05,
338
+ "loss": 1.7975865173339844,
339
+ "step": 3600
340
+ },
341
+ {
342
+ "epoch": 0.6515518379925159,
343
+ "grad_norm": 12.074219703674316,
344
+ "learning_rate": 5.60919175911252e-05,
345
+ "loss": 1.7007231140136718,
346
+ "step": 3700
347
+ },
348
+ {
349
+ "epoch": 0.6691613471274488,
350
+ "grad_norm": 28.738109588623047,
351
+ "learning_rate": 5.5986265187533014e-05,
352
+ "loss": 1.7046678161621094,
353
+ "step": 3800
354
+ },
355
+ {
356
+ "epoch": 0.6867708562623817,
357
+ "grad_norm": 17.928030014038086,
358
+ "learning_rate": 5.588061278394084e-05,
359
+ "loss": 1.876953125,
360
+ "step": 3900
361
+ },
362
+ {
363
+ "epoch": 0.7043803653973145,
364
+ "grad_norm": 8.591980934143066,
365
+ "learning_rate": 5.577496038034866e-05,
366
+ "loss": 1.8151817321777344,
367
+ "step": 4000
368
+ },
369
+ {
370
+ "epoch": 0.7043803653973145,
371
+ "eval_loss": 0.385084331035614,
372
+ "eval_mIoU": 35.32089535040148,
373
+ "eval_mean_accuracy": 44.71839496509271,
374
+ "eval_overall_accuracy": 94.84546578807749,
375
+ "eval_runtime": 594.7804,
376
+ "eval_samples_per_second": 1.942,
377
+ "eval_steps_per_second": 0.972,
378
+ "step": 4000
379
+ },
380
+ {
381
+ "epoch": 0.7219898745322474,
382
+ "grad_norm": 28.210174560546875,
383
+ "learning_rate": 5.566930797675647e-05,
384
+ "loss": 1.6734780883789062,
385
+ "step": 4100
386
+ },
387
+ {
388
+ "epoch": 0.7395993836671803,
389
+ "grad_norm": 48.83910369873047,
390
+ "learning_rate": 5.556365557316429e-05,
391
+ "loss": 1.6707070922851563,
392
+ "step": 4200
393
+ },
394
+ {
395
+ "epoch": 0.7572088928021131,
396
+ "grad_norm": 40.12311935424805,
397
+ "learning_rate": 5.5458003169572105e-05,
398
+ "loss": 1.7087435913085938,
399
+ "step": 4300
400
+ },
401
+ {
402
+ "epoch": 0.774818401937046,
403
+ "grad_norm": 6.389533042907715,
404
+ "learning_rate": 5.535235076597993e-05,
405
+ "loss": 1.7182331848144532,
406
+ "step": 4400
407
+ },
408
+ {
409
+ "epoch": 0.7924279110719789,
410
+ "grad_norm": 9.220948219299316,
411
+ "learning_rate": 5.524669836238774e-05,
412
+ "loss": 1.7504454040527344,
413
+ "step": 4500
414
+ },
415
+ {
416
+ "epoch": 0.7924279110719789,
417
+ "eval_loss": 0.3685193955898285,
418
+ "eval_mIoU": 35.59346252124521,
419
+ "eval_mean_accuracy": 46.61321173585393,
420
+ "eval_overall_accuracy": 95.03028737518179,
421
+ "eval_runtime": 596.9732,
422
+ "eval_samples_per_second": 1.935,
423
+ "eval_steps_per_second": 0.968,
424
+ "step": 4500
425
+ },
426
+ {
427
+ "epoch": 0.8100374202069117,
428
+ "grad_norm": 10.630125045776367,
429
+ "learning_rate": 5.5141045958795566e-05,
430
+ "loss": 1.6900584411621093,
431
+ "step": 4600
432
+ },
433
+ {
434
+ "epoch": 0.8276469293418446,
435
+ "grad_norm": 21.725378036499023,
436
+ "learning_rate": 5.5035393555203384e-05,
437
+ "loss": 1.5272064208984375,
438
+ "step": 4700
439
+ },
440
+ {
441
+ "epoch": 0.8452564384767774,
442
+ "grad_norm": 34.975982666015625,
443
+ "learning_rate": 5.49297411516112e-05,
444
+ "loss": 1.5466600036621094,
445
+ "step": 4800
446
+ },
447
+ {
448
+ "epoch": 0.8628659476117103,
449
+ "grad_norm": 10.243609428405762,
450
+ "learning_rate": 5.482408874801902e-05,
451
+ "loss": 1.7738760375976563,
452
+ "step": 4900
453
+ },
454
+ {
455
+ "epoch": 0.8804754567466432,
456
+ "grad_norm": 21.549283981323242,
457
+ "learning_rate": 5.471843634442683e-05,
458
+ "loss": 1.770701904296875,
459
+ "step": 5000
460
+ },
461
+ {
462
+ "epoch": 0.8804754567466432,
463
+ "eval_loss": 0.37507033348083496,
464
+ "eval_mIoU": 33.710236086968045,
465
+ "eval_mean_accuracy": 42.77628595940222,
466
+ "eval_overall_accuracy": 94.85613901377756,
467
+ "eval_runtime": 600.8517,
468
+ "eval_samples_per_second": 1.922,
469
+ "eval_steps_per_second": 0.962,
470
+ "step": 5000
471
+ },
472
+ {
473
+ "epoch": 0.898084965881576,
474
+ "grad_norm": 4.752756595611572,
475
+ "learning_rate": 5.461278394083466e-05,
476
+ "loss": 1.8512596130371093,
477
+ "step": 5100
478
+ },
479
+ {
480
+ "epoch": 0.9156944750165089,
481
+ "grad_norm": 16.470531463623047,
482
+ "learning_rate": 5.4507131537242475e-05,
483
+ "loss": 1.6076771545410156,
484
+ "step": 5200
485
+ },
486
+ {
487
+ "epoch": 0.9333039841514418,
488
+ "grad_norm": 44.30925369262695,
489
+ "learning_rate": 5.440147913365029e-05,
490
+ "loss": 1.6375923156738281,
491
+ "step": 5300
492
+ },
493
+ {
494
+ "epoch": 0.9509134932863746,
495
+ "grad_norm": 13.600090980529785,
496
+ "learning_rate": 5.429582673005811e-05,
497
+ "loss": 1.5879168701171875,
498
+ "step": 5400
499
+ },
500
+ {
501
+ "epoch": 0.9685230024213075,
502
+ "grad_norm": 14.923215866088867,
503
+ "learning_rate": 5.419017432646593e-05,
504
+ "loss": 1.786272735595703,
505
+ "step": 5500
506
+ },
507
+ {
508
+ "epoch": 0.9685230024213075,
509
+ "eval_loss": 0.3556274175643921,
510
+ "eval_mIoU": 35.76118355021881,
511
+ "eval_mean_accuracy": 45.60329420506218,
512
+ "eval_overall_accuracy": 95.1163135875355,
513
+ "eval_runtime": 610.4692,
514
+ "eval_samples_per_second": 1.892,
515
+ "eval_steps_per_second": 0.947,
516
+ "step": 5500
517
+ },
518
+ {
519
+ "epoch": 0.9861325115562404,
520
+ "grad_norm": 13.075687408447266,
521
+ "learning_rate": 5.408452192287375e-05,
522
+ "loss": 1.6160453796386718,
523
+ "step": 5600
524
+ },
525
+ {
526
+ "epoch": 1.003697996918336,
527
+ "grad_norm": 11.696391105651855,
528
+ "learning_rate": 5.397886951928156e-05,
529
+ "loss": 1.6222117614746094,
530
+ "step": 5700
531
+ },
532
+ {
533
+ "epoch": 1.0213075060532688,
534
+ "grad_norm": 8.68483829498291,
535
+ "learning_rate": 5.3873217115689384e-05,
536
+ "loss": 1.2888230895996093,
537
+ "step": 5800
538
+ },
539
+ {
540
+ "epoch": 1.0389170151882017,
541
+ "grad_norm": 11.437637329101562,
542
+ "learning_rate": 5.37675647120972e-05,
543
+ "loss": 1.4501405334472657,
544
+ "step": 5900
545
+ },
546
+ {
547
+ "epoch": 1.0565265243231345,
548
+ "grad_norm": 23.864805221557617,
549
+ "learning_rate": 5.366191230850502e-05,
550
+ "loss": 1.4908659362792969,
551
+ "step": 6000
552
+ },
553
+ {
554
+ "epoch": 1.0565265243231345,
555
+ "eval_loss": 0.37875378131866455,
556
+ "eval_mIoU": 34.90903154363175,
557
+ "eval_mean_accuracy": 45.42566443381862,
558
+ "eval_overall_accuracy": 95.06103152320499,
559
+ "eval_runtime": 616.9187,
560
+ "eval_samples_per_second": 1.872,
561
+ "eval_steps_per_second": 0.937,
562
+ "step": 6000
563
+ },
564
+ {
565
+ "epoch": 1.0741360334580674,
566
+ "grad_norm": 5.937008857727051,
567
+ "learning_rate": 5.355625990491284e-05,
568
+ "loss": 1.3125173950195312,
569
+ "step": 6100
570
+ },
571
+ {
572
+ "epoch": 1.0917455425930003,
573
+ "grad_norm": 17.99025535583496,
574
+ "learning_rate": 5.3450607501320657e-05,
575
+ "loss": 1.5096702575683594,
576
+ "step": 6200
577
+ },
578
+ {
579
+ "epoch": 1.1093550517279331,
580
+ "grad_norm": 10.604606628417969,
581
+ "learning_rate": 5.3344955097728475e-05,
582
+ "loss": 1.3583757019042968,
583
+ "step": 6300
584
+ },
585
+ {
586
+ "epoch": 1.126964560862866,
587
+ "grad_norm": 11.066084861755371,
588
+ "learning_rate": 5.323930269413629e-05,
589
+ "loss": 1.4467390441894532,
590
+ "step": 6400
591
+ },
592
+ {
593
+ "epoch": 1.1445740699977989,
594
+ "grad_norm": 3.401655435562134,
595
+ "learning_rate": 5.313365029054411e-05,
596
+ "loss": 1.393478240966797,
597
+ "step": 6500
598
+ },
599
+ {
600
+ "epoch": 1.1445740699977989,
601
+ "eval_loss": 0.37657374143600464,
602
+ "eval_mIoU": 38.11100404001698,
603
+ "eval_mean_accuracy": 48.92294650624167,
604
+ "eval_overall_accuracy": 95.20334020837561,
605
+ "eval_runtime": 638.676,
606
+ "eval_samples_per_second": 1.808,
607
+ "eval_steps_per_second": 0.905,
608
+ "step": 6500
609
+ },
610
+ {
611
+ "epoch": 1.1621835791327317,
612
+ "grad_norm": 22.327383041381836,
613
+ "learning_rate": 5.302799788695193e-05,
614
+ "loss": 1.3139019775390626,
615
+ "step": 6600
616
+ },
617
+ {
618
+ "epoch": 1.1797930882676646,
619
+ "grad_norm": 25.93901252746582,
620
+ "learning_rate": 5.292234548335975e-05,
621
+ "loss": 1.4768368530273437,
622
+ "step": 6700
623
+ },
624
+ {
625
+ "epoch": 1.1974025974025975,
626
+ "grad_norm": 11.60429573059082,
627
+ "learning_rate": 5.2816693079767565e-05,
628
+ "loss": 1.3625910949707032,
629
+ "step": 6800
630
+ },
631
+ {
632
+ "epoch": 1.2150121065375303,
633
+ "grad_norm": 4.614072799682617,
634
+ "learning_rate": 5.2711040676175384e-05,
635
+ "loss": 1.436598358154297,
636
+ "step": 6900
637
+ },
638
+ {
639
+ "epoch": 1.2326216156724632,
640
+ "grad_norm": 32.9177360534668,
641
+ "learning_rate": 5.26053882725832e-05,
642
+ "loss": 1.3963890075683594,
643
+ "step": 7000
644
+ },
645
+ {
646
+ "epoch": 1.2326216156724632,
647
+ "eval_loss": 0.36373773217201233,
648
+ "eval_mIoU": 38.23142578696723,
649
+ "eval_mean_accuracy": 48.00428340236774,
650
+ "eval_overall_accuracy": 95.36992324895157,
651
+ "eval_runtime": 623.8877,
652
+ "eval_samples_per_second": 1.851,
653
+ "eval_steps_per_second": 0.926,
654
+ "step": 7000
655
+ },
656
+ {
657
+ "epoch": 1.250231124807396,
658
+ "grad_norm": 9.769020080566406,
659
+ "learning_rate": 5.249973586899103e-05,
660
+ "loss": 1.2838912963867188,
661
+ "step": 7100
662
+ },
663
+ {
664
+ "epoch": 1.267840633942329,
665
+ "grad_norm": 11.216667175292969,
666
+ "learning_rate": 5.239408346539884e-05,
667
+ "loss": 1.3618894958496093,
668
+ "step": 7200
669
+ },
670
+ {
671
+ "epoch": 1.2854501430772618,
672
+ "grad_norm": 3.4321463108062744,
673
+ "learning_rate": 5.2288431061806656e-05,
674
+ "loss": 1.2915570068359374,
675
+ "step": 7300
676
+ },
677
+ {
678
+ "epoch": 1.3030596522121947,
679
+ "grad_norm": 7.617103099822998,
680
+ "learning_rate": 5.2182778658214474e-05,
681
+ "loss": 1.3785501098632813,
682
+ "step": 7400
683
+ },
684
+ {
685
+ "epoch": 1.3206691613471275,
686
+ "grad_norm": 5.255311965942383,
687
+ "learning_rate": 5.207712625462229e-05,
688
+ "loss": 1.4688572692871094,
689
+ "step": 7500
690
+ },
691
+ {
692
+ "epoch": 1.3206691613471275,
693
+ "eval_loss": 0.3581092953681946,
694
+ "eval_mIoU": 36.78684041274723,
695
+ "eval_mean_accuracy": 46.12063614366271,
696
+ "eval_overall_accuracy": 95.14375926096203,
697
+ "eval_runtime": 632.8318,
698
+ "eval_samples_per_second": 1.825,
699
+ "eval_steps_per_second": 0.913,
700
+ "step": 7500
701
+ },
702
+ {
703
+ "epoch": 1.3382786704820604,
704
+ "grad_norm": 59.6718635559082,
705
+ "learning_rate": 5.197147385103011e-05,
706
+ "loss": 1.5980494689941407,
707
+ "step": 7600
708
+ },
709
+ {
710
+ "epoch": 1.355888179616993,
711
+ "grad_norm": 40.1579475402832,
712
+ "learning_rate": 5.186582144743793e-05,
713
+ "loss": 1.398350830078125,
714
+ "step": 7700
715
+ },
716
+ {
717
+ "epoch": 1.3734976887519261,
718
+ "grad_norm": 44.09864807128906,
719
+ "learning_rate": 5.1760169043845754e-05,
720
+ "loss": 1.4520651245117187,
721
+ "step": 7800
722
+ },
723
+ {
724
+ "epoch": 1.3911071978868588,
725
+ "grad_norm": 7.595520496368408,
726
+ "learning_rate": 5.1654516640253565e-05,
727
+ "loss": 1.414281005859375,
728
+ "step": 7900
729
+ },
730
+ {
731
+ "epoch": 1.4087167070217919,
732
+ "grad_norm": 22.861289978027344,
733
+ "learning_rate": 5.154886423666139e-05,
734
+ "loss": 1.3919259643554687,
735
+ "step": 8000
736
+ },
737
+ {
738
+ "epoch": 1.4087167070217919,
739
+ "eval_loss": 0.3777351677417755,
740
+ "eval_mIoU": 37.04354406013157,
741
+ "eval_mean_accuracy": 49.01216587877698,
742
+ "eval_overall_accuracy": 95.28077327843867,
743
+ "eval_runtime": 633.5258,
744
+ "eval_samples_per_second": 1.823,
745
+ "eval_steps_per_second": 0.912,
746
+ "step": 8000
747
+ },
748
+ {
749
+ "epoch": 1.4263262161567245,
750
+ "grad_norm": 17.126745223999023,
751
+ "learning_rate": 5.14432118330692e-05,
752
+ "loss": 1.3992294311523437,
753
+ "step": 8100
754
+ },
755
+ {
756
+ "epoch": 1.4439357252916576,
757
+ "grad_norm": 25.60263442993164,
758
+ "learning_rate": 5.133755942947702e-05,
759
+ "loss": 1.5045437622070312,
760
+ "step": 8200
761
+ },
762
+ {
763
+ "epoch": 1.4615452344265902,
764
+ "grad_norm": 39.46979904174805,
765
+ "learning_rate": 5.123190702588484e-05,
766
+ "loss": 1.386280517578125,
767
+ "step": 8300
768
+ },
769
+ {
770
+ "epoch": 1.4791547435615233,
771
+ "grad_norm": 26.430803298950195,
772
+ "learning_rate": 5.1126254622292656e-05,
773
+ "loss": 1.395216827392578,
774
+ "step": 8400
775
+ },
776
+ {
777
+ "epoch": 1.496764252696456,
778
+ "grad_norm": 3.6278374195098877,
779
+ "learning_rate": 5.102060221870048e-05,
780
+ "loss": 1.3238540649414063,
781
+ "step": 8500
782
+ },
783
+ {
784
+ "epoch": 1.496764252696456,
785
+ "eval_loss": 0.3692784607410431,
786
+ "eval_mIoU": 38.03621070175311,
787
+ "eval_mean_accuracy": 49.83983428993074,
788
+ "eval_overall_accuracy": 95.30611112520292,
789
+ "eval_runtime": 632.3728,
790
+ "eval_samples_per_second": 1.826,
791
+ "eval_steps_per_second": 0.914,
792
+ "step": 8500
793
+ },
794
+ {
795
+ "epoch": 1.514373761831389,
796
+ "grad_norm": 10.106583595275879,
797
+ "learning_rate": 5.091494981510829e-05,
798
+ "loss": 1.341611328125,
799
+ "step": 8600
800
+ },
801
+ {
802
+ "epoch": 1.5319832709663217,
803
+ "grad_norm": 8.109859466552734,
804
+ "learning_rate": 5.080929741151612e-05,
805
+ "loss": 1.286796875,
806
+ "step": 8700
807
+ },
808
+ {
809
+ "epoch": 1.5495927801012548,
810
+ "grad_norm": 40.51174545288086,
811
+ "learning_rate": 5.070364500792393e-05,
812
+ "loss": 1.4733267211914063,
813
+ "step": 8800
814
+ },
815
+ {
816
+ "epoch": 1.5672022892361874,
817
+ "grad_norm": 8.529606819152832,
818
+ "learning_rate": 5.0597992604331754e-05,
819
+ "loss": 1.3715184020996094,
820
+ "step": 8900
821
+ },
822
+ {
823
+ "epoch": 1.5848117983711205,
824
+ "grad_norm": 10.91648006439209,
825
+ "learning_rate": 5.0492340200739565e-05,
826
+ "loss": 1.4365826416015626,
827
+ "step": 9000
828
+ },
829
+ {
830
+ "epoch": 1.5848117983711205,
831
+ "eval_loss": 0.3527390956878662,
832
+ "eval_mIoU": 38.72966019649981,
833
+ "eval_mean_accuracy": 50.33583101361378,
834
+ "eval_overall_accuracy": 95.30509519370604,
835
+ "eval_runtime": 622.2524,
836
+ "eval_samples_per_second": 1.856,
837
+ "eval_steps_per_second": 0.929,
838
+ "step": 9000
839
+ },
840
+ {
841
+ "epoch": 1.6024213075060532,
842
+ "grad_norm": 17.285547256469727,
843
+ "learning_rate": 5.038668779714738e-05,
844
+ "loss": 1.298778076171875,
845
+ "step": 9100
846
+ },
847
+ {
848
+ "epoch": 1.6200308166409862,
849
+ "grad_norm": 3.4417006969451904,
850
+ "learning_rate": 5.028103539355521e-05,
851
+ "loss": 1.3848799133300782,
852
+ "step": 9200
853
+ },
854
+ {
855
+ "epoch": 1.637640325775919,
856
+ "grad_norm": 11.60331916809082,
857
+ "learning_rate": 5.017538298996302e-05,
858
+ "loss": 1.396776123046875,
859
+ "step": 9300
860
+ },
861
+ {
862
+ "epoch": 1.655249834910852,
863
+ "grad_norm": 42.88685607910156,
864
+ "learning_rate": 5.0069730586370845e-05,
865
+ "loss": 1.5503982543945312,
866
+ "step": 9400
867
+ },
868
+ {
869
+ "epoch": 1.6728593440457846,
870
+ "grad_norm": 10.325550079345703,
871
+ "learning_rate": 4.9964078182778656e-05,
872
+ "loss": 1.3557667541503906,
873
+ "step": 9500
874
+ },
875
+ {
876
+ "epoch": 1.6728593440457846,
877
+ "eval_loss": 0.3433685302734375,
878
+ "eval_mIoU": 37.68474411400127,
879
+ "eval_mean_accuracy": 48.22518380563681,
880
+ "eval_overall_accuracy": 95.38149978175308,
881
+ "eval_runtime": 643.0868,
882
+ "eval_samples_per_second": 1.796,
883
+ "eval_steps_per_second": 0.899,
884
+ "step": 9500
885
+ },
886
+ {
887
+ "epoch": 1.6904688531807177,
888
+ "grad_norm": 7.645025253295898,
889
+ "learning_rate": 4.985842577918648e-05,
890
+ "loss": 1.3318984985351563,
891
+ "step": 9600
892
+ },
893
+ {
894
+ "epoch": 1.7080783623156504,
895
+ "grad_norm": 2.253293514251709,
896
+ "learning_rate": 4.97527733755943e-05,
897
+ "loss": 1.4566912841796875,
898
+ "step": 9700
899
+ },
900
+ {
901
+ "epoch": 1.7256878714505834,
902
+ "grad_norm": 2.5841846466064453,
903
+ "learning_rate": 4.964712097200211e-05,
904
+ "loss": 1.3018017578125,
905
+ "step": 9800
906
+ },
907
+ {
908
+ "epoch": 1.743297380585516,
909
+ "grad_norm": 5.959505081176758,
910
+ "learning_rate": 4.9541468568409935e-05,
911
+ "loss": 1.3685440063476562,
912
+ "step": 9900
913
+ },
914
+ {
915
+ "epoch": 1.7609068897204492,
916
+ "grad_norm": 21.39006996154785,
917
+ "learning_rate": 4.943581616481775e-05,
918
+ "loss": 1.267444839477539,
919
+ "step": 10000
920
+ },
921
+ {
922
+ "epoch": 1.7609068897204492,
923
+ "eval_loss": 0.3590288758277893,
924
+ "eval_mIoU": 39.250987764136376,
925
+ "eval_mean_accuracy": 51.270012242428145,
926
+ "eval_overall_accuracy": 95.32280232483174,
927
+ "eval_runtime": 643.0953,
928
+ "eval_samples_per_second": 1.796,
929
+ "eval_steps_per_second": 0.899,
930
+ "step": 10000
931
+ },
932
+ {
933
+ "epoch": 1.7785163988553818,
934
+ "grad_norm": 64.21682739257812,
935
+ "learning_rate": 4.933016376122557e-05,
936
+ "loss": 1.2918376159667968,
937
+ "step": 10100
938
+ },
939
+ {
940
+ "epoch": 1.796125907990315,
941
+ "grad_norm": 32.8283805847168,
942
+ "learning_rate": 4.922451135763338e-05,
943
+ "loss": 1.4452650451660156,
944
+ "step": 10200
945
+ },
946
+ {
947
+ "epoch": 1.8137354171252476,
948
+ "grad_norm": 11.545291900634766,
949
+ "learning_rate": 4.911885895404121e-05,
950
+ "loss": 1.2878465270996093,
951
+ "step": 10300
952
+ },
953
+ {
954
+ "epoch": 1.8313449262601806,
955
+ "grad_norm": 18.071176528930664,
956
+ "learning_rate": 4.9013206550449026e-05,
957
+ "loss": 1.3438943481445313,
958
+ "step": 10400
959
+ },
960
+ {
961
+ "epoch": 1.8489544353951133,
962
+ "grad_norm": 7.273808479309082,
963
+ "learning_rate": 4.8907554146856844e-05,
964
+ "loss": 1.2591412353515625,
965
+ "step": 10500
966
+ },
967
+ {
968
+ "epoch": 1.8489544353951133,
969
+ "eval_loss": 0.39277809858322144,
970
+ "eval_mIoU": 36.1147332767591,
971
+ "eval_mean_accuracy": 45.97273320824087,
972
+ "eval_overall_accuracy": 95.28447403020157,
973
+ "eval_runtime": 612.8948,
974
+ "eval_samples_per_second": 1.884,
975
+ "eval_steps_per_second": 0.943,
976
+ "step": 10500
977
+ },
978
+ {
979
+ "epoch": 1.8665639445300464,
980
+ "grad_norm": 27.94432830810547,
981
+ "learning_rate": 4.880190174326466e-05,
982
+ "loss": 1.218763427734375,
983
+ "step": 10600
984
+ },
985
+ {
986
+ "epoch": 1.884173453664979,
987
+ "grad_norm": 8.407777786254883,
988
+ "learning_rate": 4.8696249339672474e-05,
989
+ "loss": 1.3651194763183594,
990
+ "step": 10700
991
+ },
992
+ {
993
+ "epoch": 1.901782962799912,
994
+ "grad_norm": 20.770652770996094,
995
+ "learning_rate": 4.85905969360803e-05,
996
+ "loss": 1.3555903625488281,
997
+ "step": 10800
998
+ },
999
+ {
1000
+ "epoch": 1.9193924719348447,
1001
+ "grad_norm": 13.678817749023438,
1002
+ "learning_rate": 4.848494453248811e-05,
1003
+ "loss": 1.3331718444824219,
1004
+ "step": 10900
1005
+ },
1006
+ {
1007
+ "epoch": 1.9370019810697778,
1008
+ "grad_norm": 7.2792181968688965,
1009
+ "learning_rate": 4.8379292128895935e-05,
1010
+ "loss": 1.1297405242919922,
1011
+ "step": 11000
1012
+ },
1013
+ {
1014
+ "epoch": 1.9370019810697778,
1015
+ "eval_loss": 0.36189690232276917,
1016
+ "eval_mIoU": 38.97650392834806,
1017
+ "eval_mean_accuracy": 50.780002728102545,
1018
+ "eval_overall_accuracy": 95.34987445517535,
1019
+ "eval_runtime": 612.1048,
1020
+ "eval_samples_per_second": 1.887,
1021
+ "eval_steps_per_second": 0.944,
1022
+ "step": 11000
1023
+ },
1024
+ {
1025
+ "epoch": 1.9546114902047105,
1026
+ "grad_norm": 31.04173469543457,
1027
+ "learning_rate": 4.827363972530375e-05,
1028
+ "loss": 1.4935745239257812,
1029
+ "step": 11100
1030
+ },
1031
+ {
1032
+ "epoch": 1.9722209993396436,
1033
+ "grad_norm": 20.730045318603516,
1034
+ "learning_rate": 4.816798732171157e-05,
1035
+ "loss": 1.4070867919921874,
1036
+ "step": 11200
1037
+ },
1038
+ {
1039
+ "epoch": 1.9898305084745762,
1040
+ "grad_norm": 18.578184127807617,
1041
+ "learning_rate": 4.806233491811939e-05,
1042
+ "loss": 1.2718235778808593,
1043
+ "step": 11300
1044
+ },
1045
+ {
1046
+ "epoch": 2.007395993836672,
1047
+ "grad_norm": 7.441476821899414,
1048
+ "learning_rate": 4.79566825145272e-05,
1049
+ "loss": 1.2224794769287108,
1050
+ "step": 11400
1051
+ },
1052
+ {
1053
+ "epoch": 2.0250055029716045,
1054
+ "grad_norm": 7.709177494049072,
1055
+ "learning_rate": 4.7851030110935026e-05,
1056
+ "loss": 1.1453880310058593,
1057
+ "step": 11500
1058
+ },
1059
+ {
1060
+ "epoch": 2.0250055029716045,
1061
+ "eval_loss": 0.3579792082309723,
1062
+ "eval_mIoU": 39.1309522428395,
1063
+ "eval_mean_accuracy": 49.93403955617436,
1064
+ "eval_overall_accuracy": 95.3825044838381,
1065
+ "eval_runtime": 615.2836,
1066
+ "eval_samples_per_second": 1.877,
1067
+ "eval_steps_per_second": 0.939,
1068
+ "step": 11500
1069
+ },
1070
+ {
1071
+ "epoch": 2.0426150121065376,
1072
+ "grad_norm": 42.05501174926758,
1073
+ "learning_rate": 4.7745377707342844e-05,
1074
+ "loss": 1.2940916442871093,
1075
+ "step": 11600
1076
+ },
1077
+ {
1078
+ "epoch": 2.0602245212414703,
1079
+ "grad_norm": 13.565258026123047,
1080
+ "learning_rate": 4.763972530375066e-05,
1081
+ "loss": 1.138370361328125,
1082
+ "step": 11700
1083
+ },
1084
+ {
1085
+ "epoch": 2.0778340303764034,
1086
+ "grad_norm": 35.50266647338867,
1087
+ "learning_rate": 4.753407290015848e-05,
1088
+ "loss": 1.0196060180664062,
1089
+ "step": 11800
1090
+ },
1091
+ {
1092
+ "epoch": 2.095443539511336,
1093
+ "grad_norm": 19.02262306213379,
1094
+ "learning_rate": 4.74284204965663e-05,
1095
+ "loss": 1.1524028778076172,
1096
+ "step": 11900
1097
+ },
1098
+ {
1099
+ "epoch": 2.113053048646269,
1100
+ "grad_norm": 7.430933475494385,
1101
+ "learning_rate": 4.732276809297412e-05,
1102
+ "loss": 1.2204737854003906,
1103
+ "step": 12000
1104
+ },
1105
+ {
1106
+ "epoch": 2.113053048646269,
1107
+ "eval_loss": 0.38723915815353394,
1108
+ "eval_mIoU": 39.744055139390696,
1109
+ "eval_mean_accuracy": 52.037140691988846,
1110
+ "eval_overall_accuracy": 95.38114407361844,
1111
+ "eval_runtime": 614.3063,
1112
+ "eval_samples_per_second": 1.88,
1113
+ "eval_steps_per_second": 0.941,
1114
+ "step": 12000
1115
+ },
1116
+ {
1117
+ "epoch": 2.1306625577812017,
1118
+ "grad_norm": 12.622140884399414,
1119
+ "learning_rate": 4.7217115689381935e-05,
1120
+ "loss": 1.0923126220703125,
1121
+ "step": 12100
1122
+ },
1123
+ {
1124
+ "epoch": 2.148272066916135,
1125
+ "grad_norm": 26.150724411010742,
1126
+ "learning_rate": 4.711146328578975e-05,
1127
+ "loss": 1.1749604797363282,
1128
+ "step": 12200
1129
+ },
1130
+ {
1131
+ "epoch": 2.1658815760510675,
1132
+ "grad_norm": 12.140750885009766,
1133
+ "learning_rate": 4.700581088219757e-05,
1134
+ "loss": 1.1458908081054688,
1135
+ "step": 12300
1136
+ },
1137
+ {
1138
+ "epoch": 2.1834910851860005,
1139
+ "grad_norm": 5.676041126251221,
1140
+ "learning_rate": 4.690015847860539e-05,
1141
+ "loss": 1.1439741516113282,
1142
+ "step": 12400
1143
+ },
1144
+ {
1145
+ "epoch": 2.201100594320933,
1146
+ "grad_norm": 5.724509239196777,
1147
+ "learning_rate": 4.679450607501321e-05,
1148
+ "loss": 1.1061095428466796,
1149
+ "step": 12500
1150
+ },
1151
+ {
1152
+ "epoch": 2.201100594320933,
1153
+ "eval_loss": 0.3751870095729828,
1154
+ "eval_mIoU": 39.40716115137035,
1155
+ "eval_mean_accuracy": 50.12508859035146,
1156
+ "eval_overall_accuracy": 95.35122363598316,
1157
+ "eval_runtime": 613.3143,
1158
+ "eval_samples_per_second": 1.883,
1159
+ "eval_steps_per_second": 0.942,
1160
+ "step": 12500
1161
+ },
1162
+ {
1163
+ "epoch": 2.2187101034558663,
1164
+ "grad_norm": 21.661672592163086,
1165
+ "learning_rate": 4.6688853671421026e-05,
1166
+ "loss": 1.1017567443847656,
1167
+ "step": 12600
1168
+ },
1169
+ {
1170
+ "epoch": 2.236319612590799,
1171
+ "grad_norm": 3.0723938941955566,
1172
+ "learning_rate": 4.6583201267828844e-05,
1173
+ "loss": 1.097019500732422,
1174
+ "step": 12700
1175
+ },
1176
+ {
1177
+ "epoch": 2.253929121725732,
1178
+ "grad_norm": 20.003185272216797,
1179
+ "learning_rate": 4.647754886423666e-05,
1180
+ "loss": 1.0861209106445313,
1181
+ "step": 12800
1182
+ },
1183
+ {
1184
+ "epoch": 2.2715386308606647,
1185
+ "grad_norm": 17.646045684814453,
1186
+ "learning_rate": 4.637189646064448e-05,
1187
+ "loss": 1.1462979888916016,
1188
+ "step": 12900
1189
+ },
1190
+ {
1191
+ "epoch": 2.2891481399955977,
1192
+ "grad_norm": 6.879117488861084,
1193
+ "learning_rate": 4.62662440570523e-05,
1194
+ "loss": 1.2343074035644532,
1195
+ "step": 13000
1196
+ },
1197
+ {
1198
+ "epoch": 2.2891481399955977,
1199
+ "eval_loss": 0.35330045223236084,
1200
+ "eval_mIoU": 39.403422282692816,
1201
+ "eval_mean_accuracy": 50.84406228069122,
1202
+ "eval_overall_accuracy": 95.43958259351326,
1203
+ "eval_runtime": 614.1751,
1204
+ "eval_samples_per_second": 1.881,
1205
+ "eval_steps_per_second": 0.941,
1206
+ "step": 13000
1207
+ },
1208
+ {
1209
+ "epoch": 2.3067576491305304,
1210
+ "grad_norm": 83.66311645507812,
1211
+ "learning_rate": 4.616059165346012e-05,
1212
+ "loss": 1.0837049102783203,
1213
+ "step": 13100
1214
+ },
1215
+ {
1216
+ "epoch": 2.3243671582654635,
1217
+ "grad_norm": 27.105422973632812,
1218
+ "learning_rate": 4.6054939249867935e-05,
1219
+ "loss": 1.2298228454589843,
1220
+ "step": 13200
1221
+ },
1222
+ {
1223
+ "epoch": 2.341976667400396,
1224
+ "grad_norm": 7.361494541168213,
1225
+ "learning_rate": 4.594928684627575e-05,
1226
+ "loss": 1.1874884796142577,
1227
+ "step": 13300
1228
+ },
1229
+ {
1230
+ "epoch": 2.359586176535329,
1231
+ "grad_norm": 5.626405239105225,
1232
+ "learning_rate": 4.584363444268357e-05,
1233
+ "loss": 1.1711844635009765,
1234
+ "step": 13400
1235
+ },
1236
+ {
1237
+ "epoch": 2.377195685670262,
1238
+ "grad_norm": 5.629500865936279,
1239
+ "learning_rate": 4.5737982039091396e-05,
1240
+ "loss": 1.1417552947998046,
1241
+ "step": 13500
1242
+ },
1243
+ {
1244
+ "epoch": 2.377195685670262,
1245
+ "eval_loss": 0.3440675735473633,
1246
+ "eval_mIoU": 41.19118866588967,
1247
+ "eval_mean_accuracy": 52.981668891642265,
1248
+ "eval_overall_accuracy": 95.56694691315359,
1249
+ "eval_runtime": 615.9929,
1250
+ "eval_samples_per_second": 1.875,
1251
+ "eval_steps_per_second": 0.938,
1252
+ "step": 13500
1253
+ },
1254
+ {
1255
+ "epoch": 2.394805194805195,
1256
+ "grad_norm": 7.499139785766602,
1257
+ "learning_rate": 4.563232963549921e-05,
1258
+ "loss": 1.1351351165771484,
1259
+ "step": 13600
1260
+ },
1261
+ {
1262
+ "epoch": 2.4124147039401276,
1263
+ "grad_norm": 6.671785831451416,
1264
+ "learning_rate": 4.552667723190703e-05,
1265
+ "loss": 1.158738479614258,
1266
+ "step": 13700
1267
+ },
1268
+ {
1269
+ "epoch": 2.4300242130750607,
1270
+ "grad_norm": 5.020116806030273,
1271
+ "learning_rate": 4.5421024828314844e-05,
1272
+ "loss": 1.0873625183105469,
1273
+ "step": 13800
1274
+ },
1275
+ {
1276
+ "epoch": 2.4476337222099933,
1277
+ "grad_norm": 11.06270694732666,
1278
+ "learning_rate": 4.531537242472266e-05,
1279
+ "loss": 1.1327620697021485,
1280
+ "step": 13900
1281
+ },
1282
+ {
1283
+ "epoch": 2.4652432313449264,
1284
+ "grad_norm": 39.09502410888672,
1285
+ "learning_rate": 4.520972002113048e-05,
1286
+ "loss": 1.163224563598633,
1287
+ "step": 14000
1288
+ },
1289
+ {
1290
+ "epoch": 2.4652432313449264,
1291
+ "eval_loss": 0.37537702918052673,
1292
+ "eval_mIoU": 37.81560249206644,
1293
+ "eval_mean_accuracy": 47.31413884036508,
1294
+ "eval_overall_accuracy": 95.4164120232388,
1295
+ "eval_runtime": 621.4201,
1296
+ "eval_samples_per_second": 1.859,
1297
+ "eval_steps_per_second": 0.93,
1298
+ "step": 14000
1299
+ },
1300
+ {
1301
+ "epoch": 2.482852740479859,
1302
+ "grad_norm": 3.848895311355591,
1303
+ "learning_rate": 4.51040676175383e-05,
1304
+ "loss": 1.0415728759765626,
1305
+ "step": 14100
1306
+ },
1307
+ {
1308
+ "epoch": 2.500462249614792,
1309
+ "grad_norm": 4.380424976348877,
1310
+ "learning_rate": 4.499841521394612e-05,
1311
+ "loss": 1.1635037994384765,
1312
+ "step": 14200
1313
+ },
1314
+ {
1315
+ "epoch": 2.5180717587497248,
1316
+ "grad_norm": 37.84204864501953,
1317
+ "learning_rate": 4.4892762810353935e-05,
1318
+ "loss": 1.2334834289550782,
1319
+ "step": 14300
1320
+ },
1321
+ {
1322
+ "epoch": 2.535681267884658,
1323
+ "grad_norm": 7.818023204803467,
1324
+ "learning_rate": 4.478711040676176e-05,
1325
+ "loss": 1.0910034942626954,
1326
+ "step": 14400
1327
+ },
1328
+ {
1329
+ "epoch": 2.5532907770195905,
1330
+ "grad_norm": 19.556774139404297,
1331
+ "learning_rate": 4.468145800316957e-05,
1332
+ "loss": 1.1642417907714844,
1333
+ "step": 14500
1334
+ },
1335
+ {
1336
+ "epoch": 2.5532907770195905,
1337
+ "eval_loss": 0.3476269245147705,
1338
+ "eval_mIoU": 39.42816513930243,
1339
+ "eval_mean_accuracy": 50.40911446506301,
1340
+ "eval_overall_accuracy": 95.54313032142011,
1341
+ "eval_runtime": 630.7714,
1342
+ "eval_samples_per_second": 1.831,
1343
+ "eval_steps_per_second": 0.916,
1344
+ "step": 14500
1345
+ },
1346
+ {
1347
+ "epoch": 2.5709002861545236,
1348
+ "grad_norm": 38.74016189575195,
1349
+ "learning_rate": 4.457580559957739e-05,
1350
+ "loss": 1.0831634521484375,
1351
+ "step": 14600
1352
+ },
1353
+ {
1354
+ "epoch": 2.5885097952894562,
1355
+ "grad_norm": 11.159551620483398,
1356
+ "learning_rate": 4.447015319598521e-05,
1357
+ "loss": 1.1328179168701171,
1358
+ "step": 14700
1359
+ },
1360
+ {
1361
+ "epoch": 2.6061193044243893,
1362
+ "grad_norm": 7.955896854400635,
1363
+ "learning_rate": 4.4364500792393026e-05,
1364
+ "loss": 1.124356231689453,
1365
+ "step": 14800
1366
+ },
1367
+ {
1368
+ "epoch": 2.623728813559322,
1369
+ "grad_norm": 6.735036849975586,
1370
+ "learning_rate": 4.425884838880085e-05,
1371
+ "loss": 1.060822982788086,
1372
+ "step": 14900
1373
+ },
1374
+ {
1375
+ "epoch": 2.641338322694255,
1376
+ "grad_norm": 6.450618743896484,
1377
+ "learning_rate": 4.415319598520866e-05,
1378
+ "loss": 1.0960148620605468,
1379
+ "step": 15000
1380
+ },
1381
+ {
1382
+ "epoch": 2.641338322694255,
1383
+ "eval_loss": 0.3715696632862091,
1384
+ "eval_mIoU": 40.637422462526686,
1385
+ "eval_mean_accuracy": 51.30163306486706,
1386
+ "eval_overall_accuracy": 95.44940700778713,
1387
+ "eval_runtime": 632.007,
1388
+ "eval_samples_per_second": 1.828,
1389
+ "eval_steps_per_second": 0.915,
1390
+ "step": 15000
1391
+ },
1392
+ {
1393
+ "epoch": 2.6589478318291877,
1394
+ "grad_norm": 5.860879421234131,
1395
+ "learning_rate": 4.404754358161649e-05,
1396
+ "loss": 1.030592041015625,
1397
+ "step": 15100
1398
+ },
1399
+ {
1400
+ "epoch": 2.676557340964121,
1401
+ "grad_norm": 5.151623725891113,
1402
+ "learning_rate": 4.39418911780243e-05,
1403
+ "loss": 0.9981183624267578,
1404
+ "step": 15200
1405
+ },
1406
+ {
1407
+ "epoch": 2.6941668500990534,
1408
+ "grad_norm": 51.52006149291992,
1409
+ "learning_rate": 4.383623877443212e-05,
1410
+ "loss": 1.1631646728515626,
1411
+ "step": 15300
1412
+ },
1413
+ {
1414
+ "epoch": 2.711776359233986,
1415
+ "grad_norm": 1.7929599285125732,
1416
+ "learning_rate": 4.3730586370839935e-05,
1417
+ "loss": 1.034713134765625,
1418
+ "step": 15400
1419
+ },
1420
+ {
1421
+ "epoch": 2.729385868368919,
1422
+ "grad_norm": 79.84156799316406,
1423
+ "learning_rate": 4.362493396724775e-05,
1424
+ "loss": 1.1282410430908203,
1425
+ "step": 15500
1426
+ },
1427
+ {
1428
+ "epoch": 2.729385868368919,
1429
+ "eval_loss": 0.34207868576049805,
1430
+ "eval_mIoU": 41.725837022101224,
1431
+ "eval_mean_accuracy": 51.67503102984655,
1432
+ "eval_overall_accuracy": 95.68064702021611,
1433
+ "eval_runtime": 646.8847,
1434
+ "eval_samples_per_second": 1.785,
1435
+ "eval_steps_per_second": 0.894,
1436
+ "step": 15500
1437
+ },
1438
+ {
1439
+ "epoch": 2.7469953775038523,
1440
+ "grad_norm": 3.692952871322632,
1441
+ "learning_rate": 4.351928156365558e-05,
1442
+ "loss": 1.072099609375,
1443
+ "step": 15600
1444
+ },
1445
+ {
1446
+ "epoch": 2.764604886638785,
1447
+ "grad_norm": 57.948753356933594,
1448
+ "learning_rate": 4.341362916006339e-05,
1449
+ "loss": 1.1195967864990235,
1450
+ "step": 15700
1451
+ },
1452
+ {
1453
+ "epoch": 2.7822143957737175,
1454
+ "grad_norm": 8.935181617736816,
1455
+ "learning_rate": 4.3307976756471214e-05,
1456
+ "loss": 1.0987003326416016,
1457
+ "step": 15800
1458
+ },
1459
+ {
1460
+ "epoch": 2.7998239049086506,
1461
+ "grad_norm": 3.0621280670166016,
1462
+ "learning_rate": 4.3202324352879025e-05,
1463
+ "loss": 1.1626800537109374,
1464
+ "step": 15900
1465
+ },
1466
+ {
1467
+ "epoch": 2.8174334140435837,
1468
+ "grad_norm": 11.499585151672363,
1469
+ "learning_rate": 4.309667194928685e-05,
1470
+ "loss": 1.2044084930419923,
1471
+ "step": 16000
1472
+ },
1473
+ {
1474
+ "epoch": 2.8174334140435837,
1475
+ "eval_loss": 0.4090178608894348,
1476
+ "eval_mIoU": 38.788988881844546,
1477
+ "eval_mean_accuracy": 49.14422837445873,
1478
+ "eval_overall_accuracy": 95.46250347451213,
1479
+ "eval_runtime": 686.1121,
1480
+ "eval_samples_per_second": 1.683,
1481
+ "eval_steps_per_second": 0.842,
1482
+ "step": 16000
1483
+ },
1484
+ {
1485
+ "epoch": 2.8350429231785164,
1486
+ "grad_norm": 7.883459091186523,
1487
+ "learning_rate": 4.299101954569467e-05,
1488
+ "loss": 1.1145830535888672,
1489
+ "step": 16100
1490
+ },
1491
+ {
1492
+ "epoch": 2.852652432313449,
1493
+ "grad_norm": 26.763925552368164,
1494
+ "learning_rate": 4.288536714210248e-05,
1495
+ "loss": 1.1529721069335936,
1496
+ "step": 16200
1497
+ },
1498
+ {
1499
+ "epoch": 2.870261941448382,
1500
+ "grad_norm": 11.193148612976074,
1501
+ "learning_rate": 4.2779714738510305e-05,
1502
+ "loss": 1.1887353515625,
1503
+ "step": 16300
1504
+ },
1505
+ {
1506
+ "epoch": 2.887871450583315,
1507
+ "grad_norm": 47.4949836730957,
1508
+ "learning_rate": 4.2674062334918116e-05,
1509
+ "loss": 1.2108176422119141,
1510
+ "step": 16400
1511
+ },
1512
+ {
1513
+ "epoch": 2.905480959718248,
1514
+ "grad_norm": 18.99823570251465,
1515
+ "learning_rate": 4.256840993132594e-05,
1516
+ "loss": 1.0943442535400392,
1517
+ "step": 16500
1518
+ },
1519
+ {
1520
+ "epoch": 2.905480959718248,
1521
+ "eval_loss": 0.35304567217826843,
1522
+ "eval_mIoU": 41.13725855455199,
1523
+ "eval_mean_accuracy": 52.20547744211784,
1524
+ "eval_overall_accuracy": 95.69274142707064,
1525
+ "eval_runtime": 591.0741,
1526
+ "eval_samples_per_second": 1.954,
1527
+ "eval_steps_per_second": 0.978,
1528
+ "step": 16500
1529
+ },
1530
+ {
1531
+ "epoch": 2.9230904688531805,
1532
+ "grad_norm": 6.136702537536621,
1533
+ "learning_rate": 4.246275752773375e-05,
1534
+ "loss": 1.0625466156005858,
1535
+ "step": 16600
1536
+ },
1537
+ {
1538
+ "epoch": 2.9406999779881136,
1539
+ "grad_norm": 14.154541015625,
1540
+ "learning_rate": 4.235710512414158e-05,
1541
+ "loss": 1.0732533264160156,
1542
+ "step": 16700
1543
+ },
1544
+ {
1545
+ "epoch": 2.9583094871230466,
1546
+ "grad_norm": 3.0931496620178223,
1547
+ "learning_rate": 4.2251452720549396e-05,
1548
+ "loss": 1.0319291687011718,
1549
+ "step": 16800
1550
+ },
1551
+ {
1552
+ "epoch": 2.9759189962579793,
1553
+ "grad_norm": 80.85027313232422,
1554
+ "learning_rate": 4.2145800316957214e-05,
1555
+ "loss": 1.0832841491699219,
1556
+ "step": 16900
1557
+ },
1558
+ {
1559
+ "epoch": 2.993528505392912,
1560
+ "grad_norm": 3.672075033187866,
1561
+ "learning_rate": 4.204014791336503e-05,
1562
+ "loss": 1.2637503051757812,
1563
+ "step": 17000
1564
+ },
1565
+ {
1566
+ "epoch": 2.993528505392912,
1567
+ "eval_loss": 0.33654382824897766,
1568
+ "eval_mIoU": 41.44872246605363,
1569
+ "eval_mean_accuracy": 54.77046429937636,
1570
+ "eval_overall_accuracy": 95.56333863890016,
1571
+ "eval_runtime": 595.7763,
1572
+ "eval_samples_per_second": 1.939,
1573
+ "eval_steps_per_second": 0.97,
1574
+ "step": 17000
1575
+ },
1576
+ {
1577
+ "epoch": 3.0110939907550076,
1578
+ "grad_norm": 7.291171550750732,
1579
+ "learning_rate": 4.193449550977284e-05,
1580
+ "loss": 1.0205813598632814,
1581
+ "step": 17100
1582
+ },
1583
+ {
1584
+ "epoch": 3.0287034998899407,
1585
+ "grad_norm": 5.288455009460449,
1586
+ "learning_rate": 4.182884310618067e-05,
1587
+ "loss": 1.025837631225586,
1588
+ "step": 17200
1589
+ },
1590
+ {
1591
+ "epoch": 3.0463130090248733,
1592
+ "grad_norm": 2.849029302597046,
1593
+ "learning_rate": 4.172319070258848e-05,
1594
+ "loss": 0.8235783386230469,
1595
+ "step": 17300
1596
+ },
1597
+ {
1598
+ "epoch": 3.0639225181598064,
1599
+ "grad_norm": 4.3493499755859375,
1600
+ "learning_rate": 4.1617538298996305e-05,
1601
+ "loss": 0.9443639373779297,
1602
+ "step": 17400
1603
+ },
1604
+ {
1605
+ "epoch": 3.081532027294739,
1606
+ "grad_norm": 17.059249877929688,
1607
+ "learning_rate": 4.151188589540412e-05,
1608
+ "loss": 0.9543634033203126,
1609
+ "step": 17500
1610
+ },
1611
+ {
1612
+ "epoch": 3.081532027294739,
1613
+ "eval_loss": 0.3980509042739868,
1614
+ "eval_mIoU": 39.32169521997824,
1615
+ "eval_mean_accuracy": 48.75387080815462,
1616
+ "eval_overall_accuracy": 95.51444445853625,
1617
+ "eval_runtime": 595.8295,
1618
+ "eval_samples_per_second": 1.938,
1619
+ "eval_steps_per_second": 0.97,
1620
+ "step": 17500
1621
+ },
1622
+ {
1623
+ "epoch": 3.099141536429672,
1624
+ "grad_norm": 20.158220291137695,
1625
+ "learning_rate": 4.140623349181194e-05,
1626
+ "loss": 0.96615478515625,
1627
+ "step": 17600
1628
+ },
1629
+ {
1630
+ "epoch": 3.116751045564605,
1631
+ "grad_norm": 13.208799362182617,
1632
+ "learning_rate": 4.130058108821976e-05,
1633
+ "loss": 0.8107662963867187,
1634
+ "step": 17700
1635
+ },
1636
+ {
1637
+ "epoch": 3.134360554699538,
1638
+ "grad_norm": 1.974561095237732,
1639
+ "learning_rate": 4.119492868462757e-05,
1640
+ "loss": 0.8889852142333985,
1641
+ "step": 17800
1642
+ },
1643
+ {
1644
+ "epoch": 3.1519700638344705,
1645
+ "grad_norm": 19.499155044555664,
1646
+ "learning_rate": 4.1089276281035395e-05,
1647
+ "loss": 0.8983279418945312,
1648
+ "step": 17900
1649
+ },
1650
+ {
1651
+ "epoch": 3.1695795729694036,
1652
+ "grad_norm": 7.43156623840332,
1653
+ "learning_rate": 4.0983623877443214e-05,
1654
+ "loss": 0.843604736328125,
1655
+ "step": 18000
1656
+ },
1657
+ {
1658
+ "epoch": 3.1695795729694036,
1659
+ "eval_loss": 0.3665158748626709,
1660
+ "eval_mIoU": 40.75046102280888,
1661
+ "eval_mean_accuracy": 51.73736939649708,
1662
+ "eval_overall_accuracy": 95.71766147365818,
1663
+ "eval_runtime": 597.7525,
1664
+ "eval_samples_per_second": 1.932,
1665
+ "eval_steps_per_second": 0.967,
1666
+ "step": 18000
1667
+ },
1668
+ {
1669
+ "epoch": 3.1871890821043363,
1670
+ "grad_norm": 8.212807655334473,
1671
+ "learning_rate": 4.087797147385103e-05,
1672
+ "loss": 0.8693031311035156,
1673
+ "step": 18100
1674
+ },
1675
+ {
1676
+ "epoch": 3.2047985912392694,
1677
+ "grad_norm": 10.272090911865234,
1678
+ "learning_rate": 4.077231907025885e-05,
1679
+ "loss": 0.7922476196289062,
1680
+ "step": 18200
1681
+ },
1682
+ {
1683
+ "epoch": 3.222408100374202,
1684
+ "grad_norm": 9.316787719726562,
1685
+ "learning_rate": 4.066666666666667e-05,
1686
+ "loss": 0.9222467803955078,
1687
+ "step": 18300
1688
+ },
1689
+ {
1690
+ "epoch": 3.240017609509135,
1691
+ "grad_norm": 5.906984329223633,
1692
+ "learning_rate": 4.0561014263074486e-05,
1693
+ "loss": 0.933861312866211,
1694
+ "step": 18400
1695
+ },
1696
+ {
1697
+ "epoch": 3.2576271186440677,
1698
+ "grad_norm": 35.925132751464844,
1699
+ "learning_rate": 4.0455361859482304e-05,
1700
+ "loss": 1.147016830444336,
1701
+ "step": 18500
1702
+ },
1703
+ {
1704
+ "epoch": 3.2576271186440677,
1705
+ "eval_loss": 0.3637526333332062,
1706
+ "eval_mIoU": 40.01437254491868,
1707
+ "eval_mean_accuracy": 52.52752892592268,
1708
+ "eval_overall_accuracy": 95.57071008723535,
1709
+ "eval_runtime": 598.7356,
1710
+ "eval_samples_per_second": 1.929,
1711
+ "eval_steps_per_second": 0.965,
1712
+ "step": 18500
1713
+ },
1714
+ {
1715
+ "epoch": 3.275236627779001,
1716
+ "grad_norm": 44.39639663696289,
1717
+ "learning_rate": 4.034970945589012e-05,
1718
+ "loss": 0.9909713745117188,
1719
+ "step": 18600
1720
+ },
1721
+ {
1722
+ "epoch": 3.2928461369139335,
1723
+ "grad_norm": 7.367189407348633,
1724
+ "learning_rate": 4.024405705229794e-05,
1725
+ "loss": 0.899927978515625,
1726
+ "step": 18700
1727
+ },
1728
+ {
1729
+ "epoch": 3.3104556460488666,
1730
+ "grad_norm": 3.2386536598205566,
1731
+ "learning_rate": 4.013840464870576e-05,
1732
+ "loss": 0.900641860961914,
1733
+ "step": 18800
1734
+ },
1735
+ {
1736
+ "epoch": 3.328065155183799,
1737
+ "grad_norm": 5.339411735534668,
1738
+ "learning_rate": 4.003275224511358e-05,
1739
+ "loss": 0.8285768127441406,
1740
+ "step": 18900
1741
+ },
1742
+ {
1743
+ "epoch": 3.3456746643187323,
1744
+ "grad_norm": 7.77389669418335,
1745
+ "learning_rate": 3.9927099841521395e-05,
1746
+ "loss": 1.016840362548828,
1747
+ "step": 19000
1748
+ },
1749
+ {
1750
+ "epoch": 3.3456746643187323,
1751
+ "eval_loss": 0.35560256242752075,
1752
+ "eval_mIoU": 41.41963957275985,
1753
+ "eval_mean_accuracy": 52.9759184171816,
1754
+ "eval_overall_accuracy": 95.71307690112621,
1755
+ "eval_runtime": 598.8628,
1756
+ "eval_samples_per_second": 1.929,
1757
+ "eval_steps_per_second": 0.965,
1758
+ "step": 19000
1759
+ },
1760
+ {
1761
+ "epoch": 3.363284173453665,
1762
+ "grad_norm": 13.394330024719238,
1763
+ "learning_rate": 3.9821447437929213e-05,
1764
+ "loss": 0.8661341857910156,
1765
+ "step": 19100
1766
+ },
1767
+ {
1768
+ "epoch": 3.380893682588598,
1769
+ "grad_norm": 6.459191799163818,
1770
+ "learning_rate": 3.971579503433703e-05,
1771
+ "loss": 0.8622269439697265,
1772
+ "step": 19200
1773
+ },
1774
+ {
1775
+ "epoch": 3.3985031917235307,
1776
+ "grad_norm": 16.69118309020996,
1777
+ "learning_rate": 3.961014263074485e-05,
1778
+ "loss": 0.9276141357421875,
1779
+ "step": 19300
1780
+ },
1781
+ {
1782
+ "epoch": 3.4161127008584637,
1783
+ "grad_norm": 11.399658203125,
1784
+ "learning_rate": 3.9504490227152675e-05,
1785
+ "loss": 0.9722150421142578,
1786
+ "step": 19400
1787
+ },
1788
+ {
1789
+ "epoch": 3.4337222099933964,
1790
+ "grad_norm": 14.789872169494629,
1791
+ "learning_rate": 3.9398837823560486e-05,
1792
+ "loss": 0.930595703125,
1793
+ "step": 19500
1794
+ },
1795
+ {
1796
+ "epoch": 3.4337222099933964,
1797
+ "eval_loss": 0.3928566873073578,
1798
+ "eval_mIoU": 40.82311861205255,
1799
+ "eval_mean_accuracy": 51.636349706196874,
1800
+ "eval_overall_accuracy": 95.65218277307815,
1801
+ "eval_runtime": 599.9531,
1802
+ "eval_samples_per_second": 1.925,
1803
+ "eval_steps_per_second": 0.963,
1804
+ "step": 19500
1805
+ },
1806
+ {
1807
+ "epoch": 3.4513317191283295,
1808
+ "grad_norm": 47.58243942260742,
1809
+ "learning_rate": 3.9293185419968304e-05,
1810
+ "loss": 0.948566665649414,
1811
+ "step": 19600
1812
+ },
1813
+ {
1814
+ "epoch": 3.468941228263262,
1815
+ "grad_norm": 10.375826835632324,
1816
+ "learning_rate": 3.918753301637612e-05,
1817
+ "loss": 0.9331759643554688,
1818
+ "step": 19700
1819
+ },
1820
+ {
1821
+ "epoch": 3.486550737398195,
1822
+ "grad_norm": 27.57236099243164,
1823
+ "learning_rate": 3.908188061278394e-05,
1824
+ "loss": 0.9229088592529296,
1825
+ "step": 19800
1826
+ },
1827
+ {
1828
+ "epoch": 3.504160246533128,
1829
+ "grad_norm": 14.850144386291504,
1830
+ "learning_rate": 3.897622820919176e-05,
1831
+ "loss": 0.9040148162841797,
1832
+ "step": 19900
1833
+ },
1834
+ {
1835
+ "epoch": 3.5217697556680605,
1836
+ "grad_norm": 9.243043899536133,
1837
+ "learning_rate": 3.887057580559958e-05,
1838
+ "loss": 1.018120574951172,
1839
+ "step": 20000
1840
+ },
1841
+ {
1842
+ "epoch": 3.5217697556680605,
1843
+ "eval_loss": 0.3454851508140564,
1844
+ "eval_mIoU": 41.75683968881324,
1845
+ "eval_mean_accuracy": 54.63857579379155,
1846
+ "eval_overall_accuracy": 95.76613058775534,
1847
+ "eval_runtime": 613.735,
1848
+ "eval_samples_per_second": 1.882,
1849
+ "eval_steps_per_second": 0.942,
1850
+ "step": 20000
1851
+ },
1852
+ {
1853
+ "epoch": 3.5393792648029936,
1854
+ "grad_norm": 19.1420955657959,
1855
+ "learning_rate": 3.87649234020074e-05,
1856
+ "loss": 0.8436627197265625,
1857
+ "step": 20100
1858
+ },
1859
+ {
1860
+ "epoch": 3.5569887739379267,
1861
+ "grad_norm": 15.668157577514648,
1862
+ "learning_rate": 3.865927099841521e-05,
1863
+ "loss": 0.9943603515625,
1864
+ "step": 20200
1865
+ },
1866
+ {
1867
+ "epoch": 3.5745982830728593,
1868
+ "grad_norm": 8.847800254821777,
1869
+ "learning_rate": 3.855361859482303e-05,
1870
+ "loss": 0.959801254272461,
1871
+ "step": 20300
1872
+ },
1873
+ {
1874
+ "epoch": 3.592207792207792,
1875
+ "grad_norm": 14.564043045043945,
1876
+ "learning_rate": 3.844796619123085e-05,
1877
+ "loss": 0.8551026153564453,
1878
+ "step": 20400
1879
+ },
1880
+ {
1881
+ "epoch": 3.609817301342725,
1882
+ "grad_norm": 9.54574203491211,
1883
+ "learning_rate": 3.834231378763867e-05,
1884
+ "loss": 0.843503189086914,
1885
+ "step": 20500
1886
+ },
1887
+ {
1888
+ "epoch": 3.609817301342725,
1889
+ "eval_loss": 0.3464469313621521,
1890
+ "eval_mIoU": 41.94745733642343,
1891
+ "eval_mean_accuracy": 51.44057812491615,
1892
+ "eval_overall_accuracy": 95.820711474398,
1893
+ "eval_runtime": 619.4723,
1894
+ "eval_samples_per_second": 1.864,
1895
+ "eval_steps_per_second": 0.933,
1896
+ "step": 20500
1897
+ },
1898
+ {
1899
+ "epoch": 3.627426810477658,
1900
+ "grad_norm": 6.365943431854248,
1901
+ "learning_rate": 3.823666138404649e-05,
1902
+ "loss": 0.9280338287353516,
1903
+ "step": 20600
1904
+ },
1905
+ {
1906
+ "epoch": 3.645036319612591,
1907
+ "grad_norm": 49.77190017700195,
1908
+ "learning_rate": 3.8131008980454304e-05,
1909
+ "loss": 0.814898681640625,
1910
+ "step": 20700
1911
+ },
1912
+ {
1913
+ "epoch": 3.6626458287475234,
1914
+ "grad_norm": 22.503215789794922,
1915
+ "learning_rate": 3.802535657686213e-05,
1916
+ "loss": 0.9596369171142578,
1917
+ "step": 20800
1918
+ },
1919
+ {
1920
+ "epoch": 3.6802553378824565,
1921
+ "grad_norm": 3.472125291824341,
1922
+ "learning_rate": 3.791970417326994e-05,
1923
+ "loss": 0.7934391021728515,
1924
+ "step": 20900
1925
+ },
1926
+ {
1927
+ "epoch": 3.6978648470173896,
1928
+ "grad_norm": 7.981621265411377,
1929
+ "learning_rate": 3.7814051769677765e-05,
1930
+ "loss": 0.9479257202148438,
1931
+ "step": 21000
1932
+ },
1933
+ {
1934
+ "epoch": 3.6978648470173896,
1935
+ "eval_loss": 0.3813023269176483,
1936
+ "eval_mIoU": 40.63642183599385,
1937
+ "eval_mean_accuracy": 54.05427297237617,
1938
+ "eval_overall_accuracy": 95.5580978063278,
1939
+ "eval_runtime": 615.8201,
1940
+ "eval_samples_per_second": 1.876,
1941
+ "eval_steps_per_second": 0.939,
1942
+ "step": 21000
1943
+ },
1944
+ {
1945
+ "epoch": 3.7154743561523222,
1946
+ "grad_norm": 28.353187561035156,
1947
+ "learning_rate": 3.770839936608558e-05,
1948
+ "loss": 0.9741096496582031,
1949
+ "step": 21100
1950
+ },
1951
+ {
1952
+ "epoch": 3.733083865287255,
1953
+ "grad_norm": 15.872313499450684,
1954
+ "learning_rate": 3.7602746962493395e-05,
1955
+ "loss": 0.933817138671875,
1956
+ "step": 21200
1957
+ },
1958
+ {
1959
+ "epoch": 3.750693374422188,
1960
+ "grad_norm": 9.873473167419434,
1961
+ "learning_rate": 3.749709455890122e-05,
1962
+ "loss": 0.9153755187988282,
1963
+ "step": 21300
1964
+ },
1965
+ {
1966
+ "epoch": 3.768302883557121,
1967
+ "grad_norm": 3.8525328636169434,
1968
+ "learning_rate": 3.739144215530903e-05,
1969
+ "loss": 0.8332781219482421,
1970
+ "step": 21400
1971
+ },
1972
+ {
1973
+ "epoch": 3.7859123926920537,
1974
+ "grad_norm": 7.059874534606934,
1975
+ "learning_rate": 3.7285789751716856e-05,
1976
+ "loss": 0.8763603210449219,
1977
+ "step": 21500
1978
+ },
1979
+ {
1980
+ "epoch": 3.7859123926920537,
1981
+ "eval_loss": 0.3823384940624237,
1982
+ "eval_mIoU": 42.07849087378942,
1983
+ "eval_mean_accuracy": 53.026848381662504,
1984
+ "eval_overall_accuracy": 95.76488247165432,
1985
+ "eval_runtime": 611.8506,
1986
+ "eval_samples_per_second": 1.888,
1987
+ "eval_steps_per_second": 0.945,
1988
+ "step": 21500
1989
+ },
1990
+ {
1991
+ "epoch": 3.8035219018269864,
1992
+ "grad_norm": 3.2705864906311035,
1993
+ "learning_rate": 3.718013734812467e-05,
1994
+ "loss": 0.957579345703125,
1995
+ "step": 21600
1996
+ },
1997
+ {
1998
+ "epoch": 3.8211314109619194,
1999
+ "grad_norm": 2.298734664916992,
2000
+ "learning_rate": 3.707448494453249e-05,
2001
+ "loss": 0.939592514038086,
2002
+ "step": 21700
2003
+ },
2004
+ {
2005
+ "epoch": 3.8387409200968525,
2006
+ "grad_norm": 9.922309875488281,
2007
+ "learning_rate": 3.6968832540940304e-05,
2008
+ "loss": 0.9532173156738282,
2009
+ "step": 21800
2010
+ },
2011
+ {
2012
+ "epoch": 3.856350429231785,
2013
+ "grad_norm": 65.7906494140625,
2014
+ "learning_rate": 3.686318013734812e-05,
2015
+ "loss": 0.9110845184326172,
2016
+ "step": 21900
2017
+ },
2018
+ {
2019
+ "epoch": 3.873959938366718,
2020
+ "grad_norm": 5.08626127243042,
2021
+ "learning_rate": 3.675752773375595e-05,
2022
+ "loss": 0.9018997192382813,
2023
+ "step": 22000
2024
+ },
2025
+ {
2026
+ "epoch": 3.873959938366718,
2027
+ "eval_loss": 0.36784595251083374,
2028
+ "eval_mIoU": 40.651954450635344,
2029
+ "eval_mean_accuracy": 51.59310256241124,
2030
+ "eval_overall_accuracy": 95.59825715564546,
2031
+ "eval_runtime": 620.1319,
2032
+ "eval_samples_per_second": 1.863,
2033
+ "eval_steps_per_second": 0.932,
2034
+ "step": 22000
2035
+ },
2036
+ {
2037
+ "epoch": 3.891569447501651,
2038
+ "grad_norm": 3.0670690536499023,
2039
+ "learning_rate": 3.665187533016376e-05,
2040
+ "loss": 1.059849166870117,
2041
+ "step": 22100
2042
+ },
2043
+ {
2044
+ "epoch": 3.909178956636584,
2045
+ "grad_norm": 23.933759689331055,
2046
+ "learning_rate": 3.654622292657158e-05,
2047
+ "loss": 0.8858226013183593,
2048
+ "step": 22200
2049
+ },
2050
+ {
2051
+ "epoch": 3.9267884657715166,
2052
+ "grad_norm": 2.215423345565796,
2053
+ "learning_rate": 3.6440570522979395e-05,
2054
+ "loss": 0.9452084350585938,
2055
+ "step": 22300
2056
+ },
2057
+ {
2058
+ "epoch": 3.9443979749064493,
2059
+ "grad_norm": 309.3457336425781,
2060
+ "learning_rate": 3.633491811938722e-05,
2061
+ "loss": 0.9484812927246093,
2062
+ "step": 22400
2063
+ },
2064
+ {
2065
+ "epoch": 3.9620074840413824,
2066
+ "grad_norm": 2.219196319580078,
2067
+ "learning_rate": 3.622926571579504e-05,
2068
+ "loss": 1.0205068969726563,
2069
+ "step": 22500
2070
+ },
2071
+ {
2072
+ "epoch": 3.9620074840413824,
2073
+ "eval_loss": 0.3499414622783661,
2074
+ "eval_mIoU": 40.56537017455844,
2075
+ "eval_mean_accuracy": 52.12166106488223,
2076
+ "eval_overall_accuracy": 95.7546244039164,
2077
+ "eval_runtime": 612.0467,
2078
+ "eval_samples_per_second": 1.887,
2079
+ "eval_steps_per_second": 0.944,
2080
+ "step": 22500
2081
+ },
2082
+ {
2083
+ "epoch": 3.9796169931763155,
2084
+ "grad_norm": 24.519412994384766,
2085
+ "learning_rate": 3.6123613312202856e-05,
2086
+ "loss": 0.9474005889892578,
2087
+ "step": 22600
2088
+ },
2089
+ {
2090
+ "epoch": 3.997226502311248,
2091
+ "grad_norm": 6.02849817276001,
2092
+ "learning_rate": 3.6017960908610674e-05,
2093
+ "loss": 0.9866950225830078,
2094
+ "step": 22700
2095
+ },
2096
+ {
2097
+ "epoch": 4.014791987673344,
2098
+ "grad_norm": 10.79825210571289,
2099
+ "learning_rate": 3.5912308505018486e-05,
2100
+ "loss": 0.7545838928222657,
2101
+ "step": 22800
2102
+ },
2103
+ {
2104
+ "epoch": 4.032401496808276,
2105
+ "grad_norm": 8.403230667114258,
2106
+ "learning_rate": 3.580665610142631e-05,
2107
+ "loss": 0.8569242095947266,
2108
+ "step": 22900
2109
+ },
2110
+ {
2111
+ "epoch": 4.050011005943209,
2112
+ "grad_norm": 7.723455905914307,
2113
+ "learning_rate": 3.570100369783412e-05,
2114
+ "loss": 0.6824626922607422,
2115
+ "step": 23000
2116
+ },
2117
+ {
2118
+ "epoch": 4.050011005943209,
2119
+ "eval_loss": 0.39329513907432556,
2120
+ "eval_mIoU": 41.46868879356731,
2121
+ "eval_mean_accuracy": 51.606976880689324,
2122
+ "eval_overall_accuracy": 95.72947019106381,
2123
+ "eval_runtime": 613.8892,
2124
+ "eval_samples_per_second": 1.881,
2125
+ "eval_steps_per_second": 0.942,
2126
+ "step": 23000
2127
+ },
2128
+ {
2129
+ "epoch": 4.067620515078143,
2130
+ "grad_norm": 96.14293670654297,
2131
+ "learning_rate": 3.559535129424195e-05,
2132
+ "loss": 0.7759761810302734,
2133
+ "step": 23100
2134
+ },
2135
+ {
2136
+ "epoch": 4.085230024213075,
2137
+ "grad_norm": 19.32292938232422,
2138
+ "learning_rate": 3.5489698890649765e-05,
2139
+ "loss": 0.7245157623291015,
2140
+ "step": 23200
2141
+ },
2142
+ {
2143
+ "epoch": 4.102839533348008,
2144
+ "grad_norm": 4.930475234985352,
2145
+ "learning_rate": 3.538404648705758e-05,
2146
+ "loss": 0.7503673553466796,
2147
+ "step": 23300
2148
+ },
2149
+ {
2150
+ "epoch": 4.1204490424829405,
2151
+ "grad_norm": 8.997782707214355,
2152
+ "learning_rate": 3.52783940834654e-05,
2153
+ "loss": 0.7232845306396485,
2154
+ "step": 23400
2155
+ },
2156
+ {
2157
+ "epoch": 4.138058551617874,
2158
+ "grad_norm": 2.9045639038085938,
2159
+ "learning_rate": 3.517274167987321e-05,
2160
+ "loss": 0.7996186065673828,
2161
+ "step": 23500
2162
+ },
2163
+ {
2164
+ "epoch": 4.138058551617874,
2165
+ "eval_loss": 0.39504244923591614,
2166
+ "eval_mIoU": 41.049576590313016,
2167
+ "eval_mean_accuracy": 53.10629746092167,
2168
+ "eval_overall_accuracy": 95.63078711043188,
2169
+ "eval_runtime": 622.9242,
2170
+ "eval_samples_per_second": 1.854,
2171
+ "eval_steps_per_second": 0.928,
2172
+ "step": 23500
2173
+ },
2174
+ {
2175
+ "epoch": 4.155668060752807,
2176
+ "grad_norm": 21.821067810058594,
2177
+ "learning_rate": 3.506708927628104e-05,
2178
+ "loss": 0.7994131469726562,
2179
+ "step": 23600
2180
+ },
2181
+ {
2182
+ "epoch": 4.173277569887739,
2183
+ "grad_norm": 2.4144773483276367,
2184
+ "learning_rate": 3.496143687268885e-05,
2185
+ "loss": 0.7240392303466797,
2186
+ "step": 23700
2187
+ },
2188
+ {
2189
+ "epoch": 4.190887079022672,
2190
+ "grad_norm": 5.613311290740967,
2191
+ "learning_rate": 3.4855784469096674e-05,
2192
+ "loss": 0.7988972473144531,
2193
+ "step": 23800
2194
+ },
2195
+ {
2196
+ "epoch": 4.2084965881576055,
2197
+ "grad_norm": 2.1184654235839844,
2198
+ "learning_rate": 3.475013206550449e-05,
2199
+ "loss": 0.6988441467285156,
2200
+ "step": 23900
2201
+ },
2202
+ {
2203
+ "epoch": 4.226106097292538,
2204
+ "grad_norm": 3.8888204097747803,
2205
+ "learning_rate": 3.464447966191231e-05,
2206
+ "loss": 0.8608739471435547,
2207
+ "step": 24000
2208
+ },
2209
+ {
2210
+ "epoch": 4.226106097292538,
2211
+ "eval_loss": 0.4150463938713074,
2212
+ "eval_mIoU": 41.66218151688048,
2213
+ "eval_mean_accuracy": 52.747956293795106,
2214
+ "eval_overall_accuracy": 95.68294574688008,
2215
+ "eval_runtime": 615.4286,
2216
+ "eval_samples_per_second": 1.877,
2217
+ "eval_steps_per_second": 0.939,
2218
+ "step": 24000
2219
+ },
2220
+ {
2221
+ "epoch": 4.243715606427471,
2222
+ "grad_norm": 1.9162812232971191,
2223
+ "learning_rate": 3.453882725832013e-05,
2224
+ "loss": 0.7657085418701172,
2225
+ "step": 24100
2226
+ },
2227
+ {
2228
+ "epoch": 4.2613251155624035,
2229
+ "grad_norm": 11.44760513305664,
2230
+ "learning_rate": 3.4433174854727947e-05,
2231
+ "loss": 0.7565657043457031,
2232
+ "step": 24200
2233
+ },
2234
+ {
2235
+ "epoch": 4.278934624697337,
2236
+ "grad_norm": 11.871203422546387,
2237
+ "learning_rate": 3.4327522451135765e-05,
2238
+ "loss": 0.7799417114257813,
2239
+ "step": 24300
2240
+ },
2241
+ {
2242
+ "epoch": 4.29654413383227,
2243
+ "grad_norm": 13.05679988861084,
2244
+ "learning_rate": 3.422187004754358e-05,
2245
+ "loss": 0.7182006072998047,
2246
+ "step": 24400
2247
+ },
2248
+ {
2249
+ "epoch": 4.314153642967202,
2250
+ "grad_norm": 17.702442169189453,
2251
+ "learning_rate": 3.41162176439514e-05,
2252
+ "loss": 0.721866455078125,
2253
+ "step": 24500
2254
+ },
2255
+ {
2256
+ "epoch": 4.314153642967202,
2257
+ "eval_loss": 0.4177318215370178,
2258
+ "eval_mIoU": 41.28552847096313,
2259
+ "eval_mean_accuracy": 52.55204362802653,
2260
+ "eval_overall_accuracy": 95.7574832800663,
2261
+ "eval_runtime": 615.2573,
2262
+ "eval_samples_per_second": 1.877,
2263
+ "eval_steps_per_second": 0.939,
2264
+ "step": 24500
2265
+ },
2266
+ {
2267
+ "epoch": 4.331763152102135,
2268
+ "grad_norm": 4.1911492347717285,
2269
+ "learning_rate": 3.401056524035922e-05,
2270
+ "loss": 0.803135986328125,
2271
+ "step": 24600
2272
+ },
2273
+ {
2274
+ "epoch": 4.349372661237068,
2275
+ "grad_norm": 4.093879222869873,
2276
+ "learning_rate": 3.390491283676704e-05,
2277
+ "loss": 0.8821774291992187,
2278
+ "step": 24700
2279
+ },
2280
+ {
2281
+ "epoch": 4.366982170372001,
2282
+ "grad_norm": 7.071560859680176,
2283
+ "learning_rate": 3.3799260433174856e-05,
2284
+ "loss": 0.8138728332519531,
2285
+ "step": 24800
2286
+ },
2287
+ {
2288
+ "epoch": 4.384591679506934,
2289
+ "grad_norm": 6.610219478607178,
2290
+ "learning_rate": 3.3693608029582674e-05,
2291
+ "loss": 0.7457758331298828,
2292
+ "step": 24900
2293
+ },
2294
+ {
2295
+ "epoch": 4.402201188641866,
2296
+ "grad_norm": 9.474441528320312,
2297
+ "learning_rate": 3.358795562599049e-05,
2298
+ "loss": 0.7298115539550781,
2299
+ "step": 25000
2300
+ },
2301
+ {
2302
+ "epoch": 4.402201188641866,
2303
+ "eval_loss": 0.38879069685935974,
2304
+ "eval_mIoU": 40.43565637669389,
2305
+ "eval_mean_accuracy": 51.68485905246275,
2306
+ "eval_overall_accuracy": 95.56142798749916,
2307
+ "eval_runtime": 615.8924,
2308
+ "eval_samples_per_second": 1.875,
2309
+ "eval_steps_per_second": 0.938,
2310
+ "step": 25000
2311
+ },
2312
+ {
2313
+ "epoch": 4.4198106977768,
2314
+ "grad_norm": 16.882156372070312,
2315
+ "learning_rate": 3.348230322239831e-05,
2316
+ "loss": 0.7813544464111328,
2317
+ "step": 25100
2318
+ },
2319
+ {
2320
+ "epoch": 4.437420206911733,
2321
+ "grad_norm": 6.276833534240723,
2322
+ "learning_rate": 3.337665081880613e-05,
2323
+ "loss": 0.8473509216308593,
2324
+ "step": 25200
2325
+ },
2326
+ {
2327
+ "epoch": 4.455029716046665,
2328
+ "grad_norm": 16.890676498413086,
2329
+ "learning_rate": 3.3270998415213946e-05,
2330
+ "loss": 0.7772435760498047,
2331
+ "step": 25300
2332
+ },
2333
+ {
2334
+ "epoch": 4.472639225181598,
2335
+ "grad_norm": 35.11220932006836,
2336
+ "learning_rate": 3.3165346011621765e-05,
2337
+ "loss": 0.7341469573974609,
2338
+ "step": 25400
2339
+ },
2340
+ {
2341
+ "epoch": 4.4902487343165305,
2342
+ "grad_norm": 4.116140365600586,
2343
+ "learning_rate": 3.305969360802958e-05,
2344
+ "loss": 0.8031134033203124,
2345
+ "step": 25500
2346
+ },
2347
+ {
2348
+ "epoch": 4.4902487343165305,
2349
+ "eval_loss": 0.4111625552177429,
2350
+ "eval_mIoU": 40.938853369665615,
2351
+ "eval_mean_accuracy": 52.64935812387781,
2352
+ "eval_overall_accuracy": 95.67260973381273,
2353
+ "eval_runtime": 617.4648,
2354
+ "eval_samples_per_second": 1.871,
2355
+ "eval_steps_per_second": 0.936,
2356
+ "step": 25500
2357
+ },
2358
+ {
2359
+ "epoch": 4.507858243451464,
2360
+ "grad_norm": 19.544837951660156,
2361
+ "learning_rate": 3.29540412044374e-05,
2362
+ "loss": 0.6685540008544922,
2363
+ "step": 25600
2364
+ },
2365
+ {
2366
+ "epoch": 4.525467752586397,
2367
+ "grad_norm": 26.763763427734375,
2368
+ "learning_rate": 3.284838880084522e-05,
2369
+ "loss": 0.7029299926757813,
2370
+ "step": 25700
2371
+ },
2372
+ {
2373
+ "epoch": 4.543077261721329,
2374
+ "grad_norm": 11.457063674926758,
2375
+ "learning_rate": 3.2742736397253044e-05,
2376
+ "loss": 0.7187101745605469,
2377
+ "step": 25800
2378
+ },
2379
+ {
2380
+ "epoch": 4.560686770856263,
2381
+ "grad_norm": 4.882247447967529,
2382
+ "learning_rate": 3.2637083993660855e-05,
2383
+ "loss": 0.8353469085693359,
2384
+ "step": 25900
2385
+ },
2386
+ {
2387
+ "epoch": 4.5782962799911955,
2388
+ "grad_norm": 7.698673248291016,
2389
+ "learning_rate": 3.2531431590068674e-05,
2390
+ "loss": 0.7884654998779297,
2391
+ "step": 26000
2392
+ },
2393
+ {
2394
+ "epoch": 4.5782962799911955,
2395
+ "eval_loss": 0.4020868241786957,
2396
+ "eval_mIoU": 41.061296108771664,
2397
+ "eval_mean_accuracy": 52.12832238084668,
2398
+ "eval_overall_accuracy": 95.63389468502689,
2399
+ "eval_runtime": 615.7111,
2400
+ "eval_samples_per_second": 1.876,
2401
+ "eval_steps_per_second": 0.939,
2402
+ "step": 26000
2403
+ },
2404
+ {
2405
+ "epoch": 4.595905789126128,
2406
+ "grad_norm": 27.729001998901367,
2407
+ "learning_rate": 3.242577918647649e-05,
2408
+ "loss": 0.7050986480712891,
2409
+ "step": 26100
2410
+ },
2411
+ {
2412
+ "epoch": 4.613515298261061,
2413
+ "grad_norm": 4.676613807678223,
2414
+ "learning_rate": 3.232012678288431e-05,
2415
+ "loss": 0.8271269989013672,
2416
+ "step": 26200
2417
+ },
2418
+ {
2419
+ "epoch": 4.631124807395993,
2420
+ "grad_norm": 9.141484260559082,
2421
+ "learning_rate": 3.221447437929213e-05,
2422
+ "loss": 0.8618730163574219,
2423
+ "step": 26300
2424
+ },
2425
+ {
2426
+ "epoch": 4.648734316530927,
2427
+ "grad_norm": 22.31208610534668,
2428
+ "learning_rate": 3.2108821975699946e-05,
2429
+ "loss": 0.9146401977539063,
2430
+ "step": 26400
2431
+ },
2432
+ {
2433
+ "epoch": 4.66634382566586,
2434
+ "grad_norm": 5.31740665435791,
2435
+ "learning_rate": 3.200316957210777e-05,
2436
+ "loss": 0.7881410217285156,
2437
+ "step": 26500
2438
+ },
2439
+ {
2440
+ "epoch": 4.66634382566586,
2441
+ "eval_loss": 0.3889371454715729,
2442
+ "eval_mIoU": 39.90579024702969,
2443
+ "eval_mean_accuracy": 49.79534666070949,
2444
+ "eval_overall_accuracy": 95.63201805213829,
2445
+ "eval_runtime": 601.1009,
2446
+ "eval_samples_per_second": 1.921,
2447
+ "eval_steps_per_second": 0.962,
2448
+ "step": 26500
2449
+ },
2450
+ {
2451
+ "epoch": 4.683953334800792,
2452
+ "grad_norm": 96.29251098632812,
2453
+ "learning_rate": 3.189751716851558e-05,
2454
+ "loss": 0.7128916931152344,
2455
+ "step": 26600
2456
+ },
2457
+ {
2458
+ "epoch": 4.701562843935726,
2459
+ "grad_norm": 10.139142036437988,
2460
+ "learning_rate": 3.17918647649234e-05,
2461
+ "loss": 0.7628507232666015,
2462
+ "step": 26700
2463
+ },
2464
+ {
2465
+ "epoch": 4.719172353070658,
2466
+ "grad_norm": 3.24714732170105,
2467
+ "learning_rate": 3.168621236133122e-05,
2468
+ "loss": 0.8892244720458984,
2469
+ "step": 26800
2470
+ },
2471
+ {
2472
+ "epoch": 4.736781862205591,
2473
+ "grad_norm": 5.197122097015381,
2474
+ "learning_rate": 3.158055995773904e-05,
2475
+ "loss": 0.7311017608642578,
2476
+ "step": 26900
2477
+ },
2478
+ {
2479
+ "epoch": 4.754391371340524,
2480
+ "grad_norm": 33.49533462524414,
2481
+ "learning_rate": 3.147490755414686e-05,
2482
+ "loss": 0.7185327911376953,
2483
+ "step": 27000
2484
+ },
2485
+ {
2486
+ "epoch": 4.754391371340524,
2487
+ "eval_loss": 0.423967570066452,
2488
+ "eval_mIoU": 41.53527504353472,
2489
+ "eval_mean_accuracy": 52.98828510157863,
2490
+ "eval_overall_accuracy": 95.73358940355705,
2491
+ "eval_runtime": 593.0491,
2492
+ "eval_samples_per_second": 1.948,
2493
+ "eval_steps_per_second": 0.975,
2494
+ "step": 27000
2495
+ },
2496
+ {
2497
+ "epoch": 4.772000880475456,
2498
+ "grad_norm": 42.050235748291016,
2499
+ "learning_rate": 3.1369255150554673e-05,
2500
+ "loss": 0.748544921875,
2501
+ "step": 27100
2502
+ },
2503
+ {
2504
+ "epoch": 4.78961038961039,
2505
+ "grad_norm": 12.394989013671875,
2506
+ "learning_rate": 3.12636027469625e-05,
2507
+ "loss": 0.7695165252685547,
2508
+ "step": 27200
2509
+ },
2510
+ {
2511
+ "epoch": 4.8072198987453225,
2512
+ "grad_norm": 8.161137580871582,
2513
+ "learning_rate": 3.115795034337031e-05,
2514
+ "loss": 0.7662505340576172,
2515
+ "step": 27300
2516
+ },
2517
+ {
2518
+ "epoch": 4.824829407880255,
2519
+ "grad_norm": 5.988201141357422,
2520
+ "learning_rate": 3.1052297939778135e-05,
2521
+ "loss": 0.6720768737792969,
2522
+ "step": 27400
2523
+ },
2524
+ {
2525
+ "epoch": 4.842438917015189,
2526
+ "grad_norm": 15.133417129516602,
2527
+ "learning_rate": 3.0946645536185946e-05,
2528
+ "loss": 0.851641845703125,
2529
+ "step": 27500
2530
+ },
2531
+ {
2532
+ "epoch": 4.842438917015189,
2533
+ "eval_loss": 0.36105746030807495,
2534
+ "eval_mIoU": 42.808893326574484,
2535
+ "eval_mean_accuracy": 53.29861054528663,
2536
+ "eval_overall_accuracy": 95.81305796965893,
2537
+ "eval_runtime": 592.1747,
2538
+ "eval_samples_per_second": 1.95,
2539
+ "eval_steps_per_second": 0.976,
2540
+ "step": 27500
2541
+ },
2542
+ {
2543
+ "epoch": 4.860048426150121,
2544
+ "grad_norm": 11.938694953918457,
2545
+ "learning_rate": 3.0840993132593764e-05,
2546
+ "loss": 0.7331785583496093,
2547
+ "step": 27600
2548
+ },
2549
+ {
2550
+ "epoch": 4.877657935285054,
2551
+ "grad_norm": 6.203324794769287,
2552
+ "learning_rate": 3.073534072900159e-05,
2553
+ "loss": 0.7468854522705078,
2554
+ "step": 27700
2555
+ },
2556
+ {
2557
+ "epoch": 4.895267444419987,
2558
+ "grad_norm": 18.217580795288086,
2559
+ "learning_rate": 3.06296883254094e-05,
2560
+ "loss": 0.7335443115234375,
2561
+ "step": 27800
2562
+ },
2563
+ {
2564
+ "epoch": 4.912876953554919,
2565
+ "grad_norm": 21.941572189331055,
2566
+ "learning_rate": 3.0524035921817226e-05,
2567
+ "loss": 0.8398058319091797,
2568
+ "step": 27900
2569
+ },
2570
+ {
2571
+ "epoch": 4.930486462689853,
2572
+ "grad_norm": 9.89223861694336,
2573
+ "learning_rate": 3.041838351822504e-05,
2574
+ "loss": 0.8591268157958984,
2575
+ "step": 28000
2576
+ },
2577
+ {
2578
+ "epoch": 4.930486462689853,
2579
+ "eval_loss": 0.37627097964286804,
2580
+ "eval_mIoU": 42.55151434436105,
2581
+ "eval_mean_accuracy": 53.672845497296365,
2582
+ "eval_overall_accuracy": 95.75246142102526,
2583
+ "eval_runtime": 598.4996,
2584
+ "eval_samples_per_second": 1.93,
2585
+ "eval_steps_per_second": 0.966,
2586
+ "step": 28000
2587
+ }
2588
+ ],
2589
+ "logging_steps": 100,
2590
+ "max_steps": 56790,
2591
+ "num_input_tokens_seen": 0,
2592
+ "num_train_epochs": 10,
2593
+ "save_steps": 500,
2594
+ "stateful_callbacks": {
2595
+ "TrainerControl": {
2596
+ "args": {
2597
+ "should_epoch_stop": false,
2598
+ "should_evaluate": false,
2599
+ "should_log": false,
2600
+ "should_save": true,
2601
+ "should_training_stop": false
2602
+ },
2603
+ "attributes": {}
2604
+ }
2605
+ },
2606
+ "total_flos": 2.9002130312914797e+19,
2607
+ "train_batch_size": 2,
2608
+ "trial_name": null,
2609
+ "trial_params": null
2610
+ }
training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4e3caf59f7df69ea0fea6a384f8a7dbd4a73e773dab4a7fab5ec4ee9db372bbf
3
+ size 5137