MikeGreen2710 commited on
Commit
084c7fa
·
verified ·
1 Parent(s): 72bcb72

Upload DAPT checkpoint: microsoft__mdeberta-v3-base

Browse files
Files changed (19) hide show
  1. .gitattributes +2 -0
  2. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/config.json +39 -0
  3. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/model.safetensors +3 -0
  4. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/optimizer.pt +3 -0
  5. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/rng_state.pth +3 -0
  6. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/scheduler.pt +3 -0
  7. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/tokenizer.json +3 -0
  8. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/tokenizer_config.json +124 -0
  9. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/trainer_state.json +1543 -0
  10. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/training_args.bin +3 -0
  11. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/config.json +39 -0
  12. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/model.safetensors +3 -0
  13. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/optimizer.pt +3 -0
  14. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/rng_state.pth +3 -0
  15. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/scheduler.pt +3 -0
  16. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/tokenizer.json +3 -0
  17. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/tokenizer_config.json +124 -0
  18. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/trainer_state.json +1558 -0
  19. microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/training_args.bin +3 -0
.gitattributes CHANGED
@@ -35,3 +35,5 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
  google__rembert/tokenizer.json filter=lfs diff=lfs merge=lfs -text
37
  microsoft__mdeberta-v3-base/tokenizer.json filter=lfs diff=lfs merge=lfs -text
 
 
 
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
  google__rembert/tokenizer.json filter=lfs diff=lfs merge=lfs -text
37
  microsoft__mdeberta-v3-base/tokenizer.json filter=lfs diff=lfs merge=lfs -text
38
+ microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/tokenizer.json filter=lfs diff=lfs merge=lfs -text
39
+ microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/tokenizer.json filter=lfs diff=lfs merge=lfs -text
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/config.json ADDED
@@ -0,0 +1,39 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "DebertaV2ForMaskedLM"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": null,
7
+ "dtype": "float32",
8
+ "eos_token_id": null,
9
+ "hidden_act": "gelu",
10
+ "hidden_dropout_prob": 0.1,
11
+ "hidden_size": 768,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 3072,
14
+ "layer_norm_eps": 1e-07,
15
+ "legacy": true,
16
+ "max_position_embeddings": 512,
17
+ "max_relative_positions": -1,
18
+ "model_type": "deberta-v2",
19
+ "norm_rel_ebd": "layer_norm",
20
+ "num_attention_heads": 12,
21
+ "num_hidden_layers": 12,
22
+ "pad_token_id": 0,
23
+ "pooler_dropout": 0.0,
24
+ "pooler_hidden_act": "gelu",
25
+ "pooler_hidden_size": 768,
26
+ "pos_att_type": [
27
+ "p2c",
28
+ "c2p"
29
+ ],
30
+ "position_biased_input": false,
31
+ "position_buckets": 256,
32
+ "relative_attention": true,
33
+ "share_att_key": true,
34
+ "tie_word_embeddings": true,
35
+ "transformers_version": "5.8.0",
36
+ "type_vocab_size": 0,
37
+ "use_cache": false,
38
+ "vocab_size": 251000
39
+ }
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:adefd0372f94ec1925381281ce385e718b323150e61bf72157aa4f6534b61ace
3
+ size 1116272392
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c991c9245498dc36b22d9380a070cf49a56456ac7989ccb0e4f6c5c4cb592867
3
+ size 2232664762
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a102af4d05b2d63f44eafc045aefd457459fa247e033d14046a87c3b143f32ad
3
+ size 14244
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6cbfbf2cffbe7dd516fef85651a9b5d7027b01d5707fed36767900ecb6ae7161
3
+ size 1064
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:89ee6ed21d345eba7ad360473bde026240d8cf42fc67723b61162d9605784efa
3
+ size 16034016
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/tokenizer_config.json ADDED
@@ -0,0 +1,124 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": true,
3
+ "backend": "tokenizers",
4
+ "bos_token": "[CLS]",
5
+ "cls_token": "[CLS]",
6
+ "do_lower_case": false,
7
+ "eos_token": "[SEP]",
8
+ "extra_special_tokens": [
9
+ "[PAD]",
10
+ "[CLS]",
11
+ "[SEP]",
12
+ "▁<extra_id_99>",
13
+ "▁<extra_id_98>",
14
+ "▁<extra_id_97>",
15
+ "▁<extra_id_96>",
16
+ "▁<extra_id_95>",
17
+ "▁<extra_id_94>",
18
+ "▁<extra_id_93>",
19
+ "▁<extra_id_92>",
20
+ "▁<extra_id_91>",
21
+ "▁<extra_id_90>",
22
+ "▁<extra_id_89>",
23
+ "▁<extra_id_88>",
24
+ "▁<extra_id_87>",
25
+ "▁<extra_id_86>",
26
+ "▁<extra_id_85>",
27
+ "▁<extra_id_84>",
28
+ "▁<extra_id_83>",
29
+ "▁<extra_id_82>",
30
+ "▁<extra_id_81>",
31
+ "▁<extra_id_80>",
32
+ "▁<extra_id_79>",
33
+ "▁<extra_id_78>",
34
+ "▁<extra_id_77>",
35
+ "▁<extra_id_76>",
36
+ "▁<extra_id_75>",
37
+ "▁<extra_id_74>",
38
+ "▁<extra_id_73>",
39
+ "▁<extra_id_72>",
40
+ "▁<extra_id_71>",
41
+ "▁<extra_id_70>",
42
+ "▁<extra_id_69>",
43
+ "▁<extra_id_68>",
44
+ "▁<extra_id_67>",
45
+ "▁<extra_id_66>",
46
+ "▁<extra_id_65>",
47
+ "▁<extra_id_64>",
48
+ "▁<extra_id_63>",
49
+ "▁<extra_id_62>",
50
+ "▁<extra_id_61>",
51
+ "▁<extra_id_60>",
52
+ "▁<extra_id_59>",
53
+ "▁<extra_id_58>",
54
+ "▁<extra_id_57>",
55
+ "▁<extra_id_56>",
56
+ "▁<extra_id_55>",
57
+ "▁<extra_id_54>",
58
+ "▁<extra_id_53>",
59
+ "▁<extra_id_52>",
60
+ "▁<extra_id_51>",
61
+ "▁<extra_id_50>",
62
+ "▁<extra_id_49>",
63
+ "▁<extra_id_48>",
64
+ "▁<extra_id_47>",
65
+ "▁<extra_id_46>",
66
+ "▁<extra_id_45>",
67
+ "▁<extra_id_44>",
68
+ "▁<extra_id_43>",
69
+ "▁<extra_id_42>",
70
+ "▁<extra_id_41>",
71
+ "▁<extra_id_40>",
72
+ "▁<extra_id_39>",
73
+ "▁<extra_id_38>",
74
+ "▁<extra_id_37>",
75
+ "▁<extra_id_36>",
76
+ "▁<extra_id_35>",
77
+ "▁<extra_id_34>",
78
+ "▁<extra_id_33>",
79
+ "▁<extra_id_32>",
80
+ "▁<extra_id_31>",
81
+ "▁<extra_id_30>",
82
+ "▁<extra_id_29>",
83
+ "▁<extra_id_28>",
84
+ "▁<extra_id_27>",
85
+ "▁<extra_id_26>",
86
+ "▁<extra_id_25>",
87
+ "▁<extra_id_24>",
88
+ "▁<extra_id_23>",
89
+ "▁<extra_id_22>",
90
+ "▁<extra_id_21>",
91
+ "▁<extra_id_20>",
92
+ "▁<extra_id_19>",
93
+ "▁<extra_id_18>",
94
+ "▁<extra_id_17>",
95
+ "▁<extra_id_16>",
96
+ "▁<extra_id_15>",
97
+ "▁<extra_id_14>",
98
+ "▁<extra_id_13>",
99
+ "▁<extra_id_12>",
100
+ "▁<extra_id_11>",
101
+ "▁<extra_id_10>",
102
+ "▁<extra_id_9>",
103
+ "▁<extra_id_8>",
104
+ "▁<extra_id_7>",
105
+ "▁<extra_id_6>",
106
+ "▁<extra_id_5>",
107
+ "▁<extra_id_4>",
108
+ "▁<extra_id_3>",
109
+ "▁<extra_id_2>",
110
+ "▁<extra_id_1>",
111
+ "▁<extra_id_0>"
112
+ ],
113
+ "is_local": false,
114
+ "local_files_only": false,
115
+ "mask_token": "[MASK]",
116
+ "model_max_length": 1000000000000000019884624838656,
117
+ "pad_token": "[PAD]",
118
+ "sep_token": "[SEP]",
119
+ "split_by_punct": false,
120
+ "tokenizer_class": "DebertaV2Tokenizer",
121
+ "unk_id": 3,
122
+ "unk_token": "[UNK]",
123
+ "vocab_type": "spm"
124
+ }
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/trainer_state.json ADDED
@@ -0,0 +1,1543 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 50000,
3
+ "best_metric": 0.40101996064186096,
4
+ "best_model_checkpoint": "pretrained_checkpoints/microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000",
5
+ "epoch": 0.11061212751366059,
6
+ "eval_steps": 500,
7
+ "global_step": 50000,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.001106121275136606,
14
+ "grad_norm": 5.109910488128662,
15
+ "learning_rate": 1.9960000000000002e-05,
16
+ "loss": 0.7441332397460938,
17
+ "step": 500
18
+ },
19
+ {
20
+ "epoch": 0.001106121275136606,
21
+ "eval_loss": 0.6986047029495239,
22
+ "eval_runtime": 112.6243,
23
+ "eval_samples_per_second": 88.791,
24
+ "eval_steps_per_second": 5.549,
25
+ "step": 500
26
+ },
27
+ {
28
+ "epoch": 0.002212242550273212,
29
+ "grad_norm": 4.430311679840088,
30
+ "learning_rate": 1.9999691267175455e-05,
31
+ "loss": 0.7207266235351563,
32
+ "step": 1000
33
+ },
34
+ {
35
+ "epoch": 0.002212242550273212,
36
+ "eval_loss": 0.7042032480239868,
37
+ "eval_runtime": 113.1343,
38
+ "eval_samples_per_second": 88.39,
39
+ "eval_steps_per_second": 5.524,
40
+ "step": 1000
41
+ },
42
+ {
43
+ "epoch": 0.003318363825409818,
44
+ "grad_norm": 4.777109146118164,
45
+ "learning_rate": 1.999876261180218e-05,
46
+ "loss": 0.7199944458007812,
47
+ "step": 1500
48
+ },
49
+ {
50
+ "epoch": 0.003318363825409818,
51
+ "eval_loss": 0.6881175637245178,
52
+ "eval_runtime": 113.2438,
53
+ "eval_samples_per_second": 88.305,
54
+ "eval_steps_per_second": 5.519,
55
+ "step": 1500
56
+ },
57
+ {
58
+ "epoch": 0.004424485100546424,
59
+ "grad_norm": 5.561853885650635,
60
+ "learning_rate": 1.9997214090211625e-05,
61
+ "loss": 0.7080358276367188,
62
+ "step": 2000
63
+ },
64
+ {
65
+ "epoch": 0.004424485100546424,
66
+ "eval_loss": 0.6904817223548889,
67
+ "eval_runtime": 112.7945,
68
+ "eval_samples_per_second": 88.657,
69
+ "eval_steps_per_second": 5.541,
70
+ "step": 2000
71
+ },
72
+ {
73
+ "epoch": 0.00553060637568303,
74
+ "grad_norm": 6.21124267578125,
75
+ "learning_rate": 1.999504579840329e-05,
76
+ "loss": 0.6967091064453125,
77
+ "step": 2500
78
+ },
79
+ {
80
+ "epoch": 0.00553060637568303,
81
+ "eval_loss": 0.6767826676368713,
82
+ "eval_runtime": 113.0443,
83
+ "eval_samples_per_second": 88.461,
84
+ "eval_steps_per_second": 5.529,
85
+ "step": 2500
86
+ },
87
+ {
88
+ "epoch": 0.006636727650819636,
89
+ "grad_norm": 5.691308975219727,
90
+ "learning_rate": 1.999225787079888e-05,
91
+ "loss": 0.6900145874023438,
92
+ "step": 3000
93
+ },
94
+ {
95
+ "epoch": 0.006636727650819636,
96
+ "eval_loss": 0.6694205403327942,
97
+ "eval_runtime": 112.5418,
98
+ "eval_samples_per_second": 88.856,
99
+ "eval_steps_per_second": 5.553,
100
+ "step": 3000
101
+ },
102
+ {
103
+ "epoch": 0.0077428489259562415,
104
+ "grad_norm": 4.682841777801514,
105
+ "learning_rate": 1.998885048023401e-05,
106
+ "loss": 0.6884268188476562,
107
+ "step": 3500
108
+ },
109
+ {
110
+ "epoch": 0.0077428489259562415,
111
+ "eval_loss": 0.6560861468315125,
112
+ "eval_runtime": 112.6375,
113
+ "eval_samples_per_second": 88.78,
114
+ "eval_steps_per_second": 5.549,
115
+ "step": 3500
116
+ },
117
+ {
118
+ "epoch": 0.008848970201092848,
119
+ "grad_norm": 5.647264003753662,
120
+ "learning_rate": 1.9984823837947447e-05,
121
+ "loss": 0.682076904296875,
122
+ "step": 4000
123
+ },
124
+ {
125
+ "epoch": 0.008848970201092848,
126
+ "eval_loss": 0.6438227295875549,
127
+ "eval_runtime": 112.6746,
128
+ "eval_samples_per_second": 88.751,
129
+ "eval_steps_per_second": 5.547,
130
+ "step": 4000
131
+ },
132
+ {
133
+ "epoch": 0.009955091476229454,
134
+ "grad_norm": 5.628658771514893,
135
+ "learning_rate": 1.9980178193568023e-05,
136
+ "loss": 0.68534716796875,
137
+ "step": 4500
138
+ },
139
+ {
140
+ "epoch": 0.009955091476229454,
141
+ "eval_loss": 0.6456083059310913,
142
+ "eval_runtime": 112.6856,
143
+ "eval_samples_per_second": 88.742,
144
+ "eval_steps_per_second": 5.546,
145
+ "step": 4500
146
+ },
147
+ {
148
+ "epoch": 0.01106121275136606,
149
+ "grad_norm": 5.811315536499023,
150
+ "learning_rate": 1.9974913835099184e-05,
151
+ "loss": 0.6908584594726562,
152
+ "step": 5000
153
+ },
154
+ {
155
+ "epoch": 0.01106121275136606,
156
+ "eval_loss": 0.6402322053909302,
157
+ "eval_runtime": 113.0924,
158
+ "eval_samples_per_second": 88.423,
159
+ "eval_steps_per_second": 5.526,
160
+ "step": 5000
161
+ },
162
+ {
163
+ "epoch": 0.012167334026502667,
164
+ "grad_norm": 4.805266380310059,
165
+ "learning_rate": 1.9969031088901108e-05,
166
+ "loss": 0.6857374267578125,
167
+ "step": 5500
168
+ },
169
+ {
170
+ "epoch": 0.012167334026502667,
171
+ "eval_loss": 0.6263570785522461,
172
+ "eval_runtime": 113.3489,
173
+ "eval_samples_per_second": 88.223,
174
+ "eval_steps_per_second": 5.514,
175
+ "step": 5500
176
+ },
177
+ {
178
+ "epoch": 0.013273455301639273,
179
+ "grad_norm": 4.605637550354004,
180
+ "learning_rate": 1.9962530319670484e-05,
181
+ "loss": 0.687199462890625,
182
+ "step": 6000
183
+ },
184
+ {
185
+ "epoch": 0.013273455301639273,
186
+ "eval_loss": 0.6212612390518188,
187
+ "eval_runtime": 112.444,
188
+ "eval_samples_per_second": 88.933,
189
+ "eval_steps_per_second": 5.558,
190
+ "step": 6000
191
+ },
192
+ {
193
+ "epoch": 0.014379576576775877,
194
+ "grad_norm": 5.917664051055908,
195
+ "learning_rate": 1.9955411930417905e-05,
196
+ "loss": 0.6913502197265625,
197
+ "step": 6500
198
+ },
199
+ {
200
+ "epoch": 0.014379576576775877,
201
+ "eval_loss": 0.6166144013404846,
202
+ "eval_runtime": 113.2331,
203
+ "eval_samples_per_second": 88.313,
204
+ "eval_steps_per_second": 5.52,
205
+ "step": 6500
206
+ },
207
+ {
208
+ "epoch": 0.015485697851912483,
209
+ "grad_norm": 5.986708641052246,
210
+ "learning_rate": 1.994767636244288e-05,
211
+ "loss": 0.681802001953125,
212
+ "step": 7000
213
+ },
214
+ {
215
+ "epoch": 0.015485697851912483,
216
+ "eval_loss": 0.6170685887336731,
217
+ "eval_runtime": 112.4446,
218
+ "eval_samples_per_second": 88.933,
219
+ "eval_steps_per_second": 5.558,
220
+ "step": 7000
221
+ },
222
+ {
223
+ "epoch": 0.01659181912704909,
224
+ "grad_norm": 5.719727516174316,
225
+ "learning_rate": 1.9939324095306473e-05,
226
+ "loss": 0.683607666015625,
227
+ "step": 7500
228
+ },
229
+ {
230
+ "epoch": 0.01659181912704909,
231
+ "eval_loss": 0.6028082370758057,
232
+ "eval_runtime": 111.9443,
233
+ "eval_samples_per_second": 89.33,
234
+ "eval_steps_per_second": 5.583,
235
+ "step": 7500
236
+ },
237
+ {
238
+ "epoch": 0.017697940402185697,
239
+ "grad_norm": 4.734459400177002,
240
+ "learning_rate": 1.9930355646801577e-05,
241
+ "loss": 0.6903638916015625,
242
+ "step": 8000
243
+ },
244
+ {
245
+ "epoch": 0.017697940402185697,
246
+ "eval_loss": 0.5941663980484009,
247
+ "eval_runtime": 112.5492,
248
+ "eval_samples_per_second": 88.85,
249
+ "eval_steps_per_second": 5.553,
250
+ "step": 8000
251
+ },
252
+ {
253
+ "epoch": 0.018804061677322303,
254
+ "grad_norm": 4.0714111328125,
255
+ "learning_rate": 1.992077157292082e-05,
256
+ "loss": 0.6867118530273437,
257
+ "step": 8500
258
+ },
259
+ {
260
+ "epoch": 0.018804061677322303,
261
+ "eval_loss": 0.5876705050468445,
262
+ "eval_runtime": 112.7258,
263
+ "eval_samples_per_second": 88.711,
264
+ "eval_steps_per_second": 5.544,
265
+ "step": 8500
266
+ },
267
+ {
268
+ "epoch": 0.01991018295245891,
269
+ "grad_norm": 4.817986965179443,
270
+ "learning_rate": 1.991057246782208e-05,
271
+ "loss": 0.6845618286132813,
272
+ "step": 9000
273
+ },
274
+ {
275
+ "epoch": 0.01991018295245891,
276
+ "eval_loss": 0.5870856642723083,
277
+ "eval_runtime": 112.4215,
278
+ "eval_samples_per_second": 88.951,
279
+ "eval_steps_per_second": 5.559,
280
+ "step": 9000
281
+ },
282
+ {
283
+ "epoch": 0.021016304227595515,
284
+ "grad_norm": 5.057409763336182,
285
+ "learning_rate": 1.989975896379167e-05,
286
+ "loss": 0.6727237548828126,
287
+ "step": 9500
288
+ },
289
+ {
290
+ "epoch": 0.021016304227595515,
291
+ "eval_loss": 0.5813655853271484,
292
+ "eval_runtime": 112.6353,
293
+ "eval_samples_per_second": 88.782,
294
+ "eval_steps_per_second": 5.549,
295
+ "step": 9500
296
+ },
297
+ {
298
+ "epoch": 0.02212242550273212,
299
+ "grad_norm": 4.090648174285889,
300
+ "learning_rate": 1.9888331731205117e-05,
301
+ "loss": 0.6655429077148437,
302
+ "step": 10000
303
+ },
304
+ {
305
+ "epoch": 0.02212242550273212,
306
+ "eval_loss": 0.5734274387359619,
307
+ "eval_runtime": 112.9725,
308
+ "eval_samples_per_second": 88.517,
309
+ "eval_steps_per_second": 5.532,
310
+ "step": 10000
311
+ },
312
+ {
313
+ "epoch": 0.023228546777868727,
314
+ "grad_norm": 4.4758148193359375,
315
+ "learning_rate": 1.9876291478485632e-05,
316
+ "loss": 0.6645328979492188,
317
+ "step": 10500
318
+ },
319
+ {
320
+ "epoch": 0.023228546777868727,
321
+ "eval_loss": 0.5689971446990967,
322
+ "eval_runtime": 112.1723,
323
+ "eval_samples_per_second": 89.149,
324
+ "eval_steps_per_second": 5.572,
325
+ "step": 10500
326
+ },
327
+ {
328
+ "epoch": 0.024334668053005333,
329
+ "grad_norm": 4.342129707336426,
330
+ "learning_rate": 1.9863638952060165e-05,
331
+ "loss": 0.6613389892578125,
332
+ "step": 11000
333
+ },
334
+ {
335
+ "epoch": 0.024334668053005333,
336
+ "eval_loss": 0.5666700005531311,
337
+ "eval_runtime": 112.6281,
338
+ "eval_samples_per_second": 88.788,
339
+ "eval_steps_per_second": 5.549,
340
+ "step": 11000
341
+ },
342
+ {
343
+ "epoch": 0.02544078932814194,
344
+ "grad_norm": 4.324596405029297,
345
+ "learning_rate": 1.9850374936313145e-05,
346
+ "loss": 0.6489639892578125,
347
+ "step": 11500
348
+ },
349
+ {
350
+ "epoch": 0.02544078932814194,
351
+ "eval_loss": 0.5580319166183472,
352
+ "eval_runtime": 113.0466,
353
+ "eval_samples_per_second": 88.459,
354
+ "eval_steps_per_second": 5.529,
355
+ "step": 11500
356
+ },
357
+ {
358
+ "epoch": 0.026546910603278545,
359
+ "grad_norm": 3.868192434310913,
360
+ "learning_rate": 1.9836500253537848e-05,
361
+ "loss": 0.651514892578125,
362
+ "step": 12000
363
+ },
364
+ {
365
+ "epoch": 0.026546910603278545,
366
+ "eval_loss": 0.5508246421813965,
367
+ "eval_runtime": 113.0398,
368
+ "eval_samples_per_second": 88.464,
369
+ "eval_steps_per_second": 5.529,
370
+ "step": 12000
371
+ },
372
+ {
373
+ "epoch": 0.027653031878415148,
374
+ "grad_norm": 4.028125762939453,
375
+ "learning_rate": 1.9822015763885417e-05,
376
+ "loss": 0.6445519409179687,
377
+ "step": 12500
378
+ },
379
+ {
380
+ "epoch": 0.027653031878415148,
381
+ "eval_loss": 0.5496281385421753,
382
+ "eval_runtime": 113.2586,
383
+ "eval_samples_per_second": 88.294,
384
+ "eval_steps_per_second": 5.518,
385
+ "step": 12500
386
+ },
387
+ {
388
+ "epoch": 0.028759153153551754,
389
+ "grad_norm": 4.765957355499268,
390
+ "learning_rate": 1.9806922365311553e-05,
391
+ "loss": 0.6352955322265625,
392
+ "step": 13000
393
+ },
394
+ {
395
+ "epoch": 0.028759153153551754,
396
+ "eval_loss": 0.5461284518241882,
397
+ "eval_runtime": 112.1974,
398
+ "eval_samples_per_second": 89.129,
399
+ "eval_steps_per_second": 5.571,
400
+ "step": 13000
401
+ },
402
+ {
403
+ "epoch": 0.02986527442868836,
404
+ "grad_norm": 4.099660873413086,
405
+ "learning_rate": 1.979122099352082e-05,
406
+ "loss": 0.6299137573242187,
407
+ "step": 13500
408
+ },
409
+ {
410
+ "epoch": 0.02986527442868836,
411
+ "eval_loss": 0.5498659610748291,
412
+ "eval_runtime": 111.8065,
413
+ "eval_samples_per_second": 89.44,
414
+ "eval_steps_per_second": 5.59,
415
+ "step": 13500
416
+ },
417
+ {
418
+ "epoch": 0.030971395703824966,
419
+ "grad_norm": 4.601438045501709,
420
+ "learning_rate": 1.9774912621908665e-05,
421
+ "loss": 0.6282794189453125,
422
+ "step": 14000
423
+ },
424
+ {
425
+ "epoch": 0.030971395703824966,
426
+ "eval_loss": 0.541534960269928,
427
+ "eval_runtime": 111.9289,
428
+ "eval_samples_per_second": 89.342,
429
+ "eval_steps_per_second": 5.584,
430
+ "step": 14000
431
+ },
432
+ {
433
+ "epoch": 0.03207751697896157,
434
+ "grad_norm": 5.145658493041992,
435
+ "learning_rate": 1.9757998261501047e-05,
436
+ "loss": 0.6148015747070312,
437
+ "step": 14500
438
+ },
439
+ {
440
+ "epoch": 0.03207751697896157,
441
+ "eval_loss": 0.5281656980514526,
442
+ "eval_runtime": 111.8633,
443
+ "eval_samples_per_second": 89.395,
444
+ "eval_steps_per_second": 5.587,
445
+ "step": 14500
446
+ },
447
+ {
448
+ "epoch": 0.03318363825409818,
449
+ "grad_norm": 4.646543979644775,
450
+ "learning_rate": 1.9740478960891782e-05,
451
+ "loss": 0.6079625854492188,
452
+ "step": 15000
453
+ },
454
+ {
455
+ "epoch": 0.03318363825409818,
456
+ "eval_loss": 0.5313529372215271,
457
+ "eval_runtime": 112.1519,
458
+ "eval_samples_per_second": 89.165,
459
+ "eval_steps_per_second": 5.573,
460
+ "step": 15000
461
+ },
462
+ {
463
+ "epoch": 0.034289759529234784,
464
+ "grad_norm": 4.390852928161621,
465
+ "learning_rate": 1.972235580617752e-05,
466
+ "loss": 0.6054973754882812,
467
+ "step": 15500
468
+ },
469
+ {
470
+ "epoch": 0.034289759529234784,
471
+ "eval_loss": 0.5350580811500549,
472
+ "eval_runtime": 113.7911,
473
+ "eval_samples_per_second": 87.88,
474
+ "eval_steps_per_second": 5.493,
475
+ "step": 15500
476
+ },
477
+ {
478
+ "epoch": 0.035395880804371394,
479
+ "grad_norm": 4.278556823730469,
480
+ "learning_rate": 1.970362992089042e-05,
481
+ "loss": 0.6086318969726563,
482
+ "step": 16000
483
+ },
484
+ {
485
+ "epoch": 0.035395880804371394,
486
+ "eval_loss": 0.5248209238052368,
487
+ "eval_runtime": 112.3769,
488
+ "eval_samples_per_second": 88.986,
489
+ "eval_steps_per_second": 5.562,
490
+ "step": 16000
491
+ },
492
+ {
493
+ "epoch": 0.036502002079507996,
494
+ "grad_norm": 4.178222179412842,
495
+ "learning_rate": 1.96843024659285e-05,
496
+ "loss": 0.6051075439453125,
497
+ "step": 16500
498
+ },
499
+ {
500
+ "epoch": 0.036502002079507996,
501
+ "eval_loss": 0.5181564092636108,
502
+ "eval_runtime": 112.438,
503
+ "eval_samples_per_second": 88.938,
504
+ "eval_steps_per_second": 5.559,
505
+ "step": 16500
506
+ },
507
+ {
508
+ "epoch": 0.037608123354644606,
509
+ "grad_norm": 3.8288681507110596,
510
+ "learning_rate": 1.9664374639483664e-05,
511
+ "loss": 0.5989437255859374,
512
+ "step": 17000
513
+ },
514
+ {
515
+ "epoch": 0.037608123354644606,
516
+ "eval_loss": 0.521802544593811,
517
+ "eval_runtime": 112.6381,
518
+ "eval_samples_per_second": 88.78,
519
+ "eval_steps_per_second": 5.549,
520
+ "step": 17000
521
+ },
522
+ {
523
+ "epoch": 0.03871424462978121,
524
+ "grad_norm": 3.432649612426758,
525
+ "learning_rate": 1.964384767696742e-05,
526
+ "loss": 0.6005252075195312,
527
+ "step": 17500
528
+ },
529
+ {
530
+ "epoch": 0.03871424462978121,
531
+ "eval_loss": 0.5095081329345703,
532
+ "eval_runtime": 112.255,
533
+ "eval_samples_per_second": 89.083,
534
+ "eval_steps_per_second": 5.568,
535
+ "step": 17500
536
+ },
537
+ {
538
+ "epoch": 0.03982036590491782,
539
+ "grad_norm": 4.271261692047119,
540
+ "learning_rate": 1.962272285093429e-05,
541
+ "loss": 0.58925830078125,
542
+ "step": 18000
543
+ },
544
+ {
545
+ "epoch": 0.03982036590491782,
546
+ "eval_loss": 0.5169823169708252,
547
+ "eval_runtime": 111.6701,
548
+ "eval_samples_per_second": 89.55,
549
+ "eval_steps_per_second": 5.597,
550
+ "step": 18000
551
+ },
552
+ {
553
+ "epoch": 0.04092648718005442,
554
+ "grad_norm": 3.561911106109619,
555
+ "learning_rate": 1.960100147100293e-05,
556
+ "loss": 0.58902587890625,
557
+ "step": 18500
558
+ },
559
+ {
560
+ "epoch": 0.04092648718005442,
561
+ "eval_loss": 0.5074495673179626,
562
+ "eval_runtime": 112.1639,
563
+ "eval_samples_per_second": 89.155,
564
+ "eval_steps_per_second": 5.572,
565
+ "step": 18500
566
+ },
567
+ {
568
+ "epoch": 0.04203260845519103,
569
+ "grad_norm": 3.64815616607666,
570
+ "learning_rate": 1.9578684883774925e-05,
571
+ "loss": 0.5864580688476563,
572
+ "step": 19000
573
+ },
574
+ {
575
+ "epoch": 0.04203260845519103,
576
+ "eval_loss": 0.5057380199432373,
577
+ "eval_runtime": 113.2061,
578
+ "eval_samples_per_second": 88.334,
579
+ "eval_steps_per_second": 5.521,
580
+ "step": 19000
581
+ },
582
+ {
583
+ "epoch": 0.04313872973032763,
584
+ "grad_norm": 4.534627437591553,
585
+ "learning_rate": 1.9555774472751313e-05,
586
+ "loss": 0.5786356811523438,
587
+ "step": 19500
588
+ },
589
+ {
590
+ "epoch": 0.04313872973032763,
591
+ "eval_loss": 0.5002171397209167,
592
+ "eval_runtime": 111.5667,
593
+ "eval_samples_per_second": 89.633,
594
+ "eval_steps_per_second": 5.602,
595
+ "step": 19500
596
+ },
597
+ {
598
+ "epoch": 0.04424485100546424,
599
+ "grad_norm": 4.598667144775391,
600
+ "learning_rate": 1.9532271658246834e-05,
601
+ "loss": 0.572388427734375,
602
+ "step": 20000
603
+ },
604
+ {
605
+ "epoch": 0.04424485100546424,
606
+ "eval_loss": 0.495422899723053,
607
+ "eval_runtime": 112.3374,
608
+ "eval_samples_per_second": 89.018,
609
+ "eval_steps_per_second": 5.564,
610
+ "step": 20000
611
+ },
612
+ {
613
+ "epoch": 0.045350972280600844,
614
+ "grad_norm": 3.4895408153533936,
615
+ "learning_rate": 1.9508177897301847e-05,
616
+ "loss": 0.5747387084960938,
617
+ "step": 20500
618
+ },
619
+ {
620
+ "epoch": 0.045350972280600844,
621
+ "eval_loss": 0.4933762550354004,
622
+ "eval_runtime": 111.8998,
623
+ "eval_samples_per_second": 89.366,
624
+ "eval_steps_per_second": 5.585,
625
+ "step": 20500
626
+ },
627
+ {
628
+ "epoch": 0.046457093555737454,
629
+ "grad_norm": 3.8103654384613037,
630
+ "learning_rate": 1.9483494683592022e-05,
631
+ "loss": 0.5658125610351562,
632
+ "step": 21000
633
+ },
634
+ {
635
+ "epoch": 0.046457093555737454,
636
+ "eval_loss": 0.49491196870803833,
637
+ "eval_runtime": 111.4759,
638
+ "eval_samples_per_second": 89.706,
639
+ "eval_steps_per_second": 5.607,
640
+ "step": 21000
641
+ },
642
+ {
643
+ "epoch": 0.04756321483087406,
644
+ "grad_norm": 3.7526588439941406,
645
+ "learning_rate": 1.9458223547335746e-05,
646
+ "loss": 0.563939453125,
647
+ "step": 21500
648
+ },
649
+ {
650
+ "epoch": 0.04756321483087406,
651
+ "eval_loss": 0.4922999143600464,
652
+ "eval_runtime": 112.4782,
653
+ "eval_samples_per_second": 88.906,
654
+ "eval_steps_per_second": 5.557,
655
+ "step": 21500
656
+ },
657
+ {
658
+ "epoch": 0.048669336106010666,
659
+ "grad_norm": 3.5741498470306396,
660
+ "learning_rate": 1.943236605519923e-05,
661
+ "loss": 0.5666294555664062,
662
+ "step": 22000
663
+ },
664
+ {
665
+ "epoch": 0.048669336106010666,
666
+ "eval_loss": 0.49273720383644104,
667
+ "eval_runtime": 112.8352,
668
+ "eval_samples_per_second": 88.625,
669
+ "eval_steps_per_second": 5.539,
670
+ "step": 22000
671
+ },
672
+ {
673
+ "epoch": 0.04977545738114727,
674
+ "grad_norm": 3.897984266281128,
675
+ "learning_rate": 1.9405923810199418e-05,
676
+ "loss": 0.5635711669921875,
677
+ "step": 22500
678
+ },
679
+ {
680
+ "epoch": 0.04977545738114727,
681
+ "eval_loss": 0.48471200466156006,
682
+ "eval_runtime": 111.5955,
683
+ "eval_samples_per_second": 89.609,
684
+ "eval_steps_per_second": 5.601,
685
+ "step": 22500
686
+ },
687
+ {
688
+ "epoch": 0.05088157865628388,
689
+ "grad_norm": 4.313111305236816,
690
+ "learning_rate": 1.9378898451604587e-05,
691
+ "loss": 0.5571904907226563,
692
+ "step": 23000
693
+ },
694
+ {
695
+ "epoch": 0.05088157865628388,
696
+ "eval_loss": 0.4867466390132904,
697
+ "eval_runtime": 112.4813,
698
+ "eval_samples_per_second": 88.904,
699
+ "eval_steps_per_second": 5.556,
700
+ "step": 23000
701
+ },
702
+ {
703
+ "epoch": 0.05198769993142048,
704
+ "grad_norm": 3.905113458633423,
705
+ "learning_rate": 1.935129165483274e-05,
706
+ "loss": 0.5491801147460937,
707
+ "step": 23500
708
+ },
709
+ {
710
+ "epoch": 0.05198769993142048,
711
+ "eval_loss": 0.4905949831008911,
712
+ "eval_runtime": 112.4885,
713
+ "eval_samples_per_second": 88.898,
714
+ "eval_steps_per_second": 5.556,
715
+ "step": 23500
716
+ },
717
+ {
718
+ "epoch": 0.05309382120655709,
719
+ "grad_norm": 4.165647983551025,
720
+ "learning_rate": 1.932310513134771e-05,
721
+ "loss": 0.5534236450195312,
722
+ "step": 24000
723
+ },
724
+ {
725
+ "epoch": 0.05309382120655709,
726
+ "eval_loss": 0.4770846664905548,
727
+ "eval_runtime": 112.5119,
728
+ "eval_samples_per_second": 88.879,
729
+ "eval_steps_per_second": 5.555,
730
+ "step": 24000
731
+ },
732
+ {
733
+ "epoch": 0.05419994248169369,
734
+ "grad_norm": 3.8773398399353027,
735
+ "learning_rate": 1.9294340628553093e-05,
736
+ "loss": 0.5511622924804688,
737
+ "step": 24500
738
+ },
739
+ {
740
+ "epoch": 0.05419994248169369,
741
+ "eval_loss": 0.4724074602127075,
742
+ "eval_runtime": 112.4911,
743
+ "eval_samples_per_second": 88.896,
744
+ "eval_steps_per_second": 5.556,
745
+ "step": 24500
746
+ },
747
+ {
748
+ "epoch": 0.055306063756830295,
749
+ "grad_norm": 4.676408767700195,
750
+ "learning_rate": 1.9264999929683895e-05,
751
+ "loss": 0.5429652709960937,
752
+ "step": 25000
753
+ },
754
+ {
755
+ "epoch": 0.055306063756830295,
756
+ "eval_loss": 0.4698111414909363,
757
+ "eval_runtime": 113.1395,
758
+ "eval_samples_per_second": 88.386,
759
+ "eval_steps_per_second": 5.524,
760
+ "step": 25000
761
+ },
762
+ {
763
+ "epoch": 0.056412185031966905,
764
+ "grad_norm": 4.590200424194336,
765
+ "learning_rate": 1.9235084853695998e-05,
766
+ "loss": 0.5434938354492187,
767
+ "step": 25500
768
+ },
769
+ {
770
+ "epoch": 0.056412185031966905,
771
+ "eval_loss": 0.4745750427246094,
772
+ "eval_runtime": 112.4034,
773
+ "eval_samples_per_second": 88.965,
774
+ "eval_steps_per_second": 5.56,
775
+ "step": 25500
776
+ },
777
+ {
778
+ "epoch": 0.05751830630710351,
779
+ "grad_norm": 3.6507468223571777,
780
+ "learning_rate": 1.920459725515338e-05,
781
+ "loss": 0.5387776489257813,
782
+ "step": 26000
783
+ },
784
+ {
785
+ "epoch": 0.05751830630710351,
786
+ "eval_loss": 0.4783058166503906,
787
+ "eval_runtime": 112.4433,
788
+ "eval_samples_per_second": 88.934,
789
+ "eval_steps_per_second": 5.558,
790
+ "step": 26000
791
+ },
792
+ {
793
+ "epoch": 0.05862442758224012,
794
+ "grad_norm": 4.008069038391113,
795
+ "learning_rate": 1.917353902411315e-05,
796
+ "loss": 0.543491455078125,
797
+ "step": 26500
798
+ },
799
+ {
800
+ "epoch": 0.05862442758224012,
801
+ "eval_loss": 0.4737086892127991,
802
+ "eval_runtime": 112.6279,
803
+ "eval_samples_per_second": 88.788,
804
+ "eval_steps_per_second": 5.549,
805
+ "step": 26500
806
+ },
807
+ {
808
+ "epoch": 0.05973054885737672,
809
+ "grad_norm": 5.477914810180664,
810
+ "learning_rate": 1.9141912086008383e-05,
811
+ "loss": 0.5376876220703125,
812
+ "step": 27000
813
+ },
814
+ {
815
+ "epoch": 0.05973054885737672,
816
+ "eval_loss": 0.4720275402069092,
817
+ "eval_runtime": 111.9032,
818
+ "eval_samples_per_second": 89.363,
819
+ "eval_steps_per_second": 5.585,
820
+ "step": 27000
821
+ },
822
+ {
823
+ "epoch": 0.06083667013251333,
824
+ "grad_norm": 3.8908817768096924,
825
+ "learning_rate": 1.9109718401528742e-05,
826
+ "loss": 0.5346746215820313,
827
+ "step": 27500
828
+ },
829
+ {
830
+ "epoch": 0.06083667013251333,
831
+ "eval_loss": 0.46936094760894775,
832
+ "eval_runtime": 114.3673,
833
+ "eval_samples_per_second": 87.438,
834
+ "eval_steps_per_second": 5.465,
835
+ "step": 27500
836
+ },
837
+ {
838
+ "epoch": 0.06194279140764993,
839
+ "grad_norm": 5.77609920501709,
840
+ "learning_rate": 1.907695996649892e-05,
841
+ "loss": 0.5293397827148437,
842
+ "step": 28000
843
+ },
844
+ {
845
+ "epoch": 0.06194279140764993,
846
+ "eval_loss": 0.47076907753944397,
847
+ "eval_runtime": 112.4252,
848
+ "eval_samples_per_second": 88.948,
849
+ "eval_steps_per_second": 5.559,
850
+ "step": 28000
851
+ },
852
+ {
853
+ "epoch": 0.06304891268278653,
854
+ "grad_norm": 3.0727529525756836,
855
+ "learning_rate": 1.9043638811754942e-05,
856
+ "loss": 0.5365479125976562,
857
+ "step": 28500
858
+ },
859
+ {
860
+ "epoch": 0.06304891268278653,
861
+ "eval_loss": 0.4585624635219574,
862
+ "eval_runtime": 112.8923,
863
+ "eval_samples_per_second": 88.58,
864
+ "eval_steps_per_second": 5.536,
865
+ "step": 28500
866
+ },
867
+ {
868
+ "epoch": 0.06415503395792314,
869
+ "grad_norm": 4.541342258453369,
870
+ "learning_rate": 1.900975700301823e-05,
871
+ "loss": 0.526941162109375,
872
+ "step": 29000
873
+ },
874
+ {
875
+ "epoch": 0.06415503395792314,
876
+ "eval_loss": 0.4596991240978241,
877
+ "eval_runtime": 112.2872,
878
+ "eval_samples_per_second": 89.057,
879
+ "eval_steps_per_second": 5.566,
880
+ "step": 29000
881
+ },
882
+ {
883
+ "epoch": 0.06526115523305975,
884
+ "grad_norm": 3.3814268112182617,
885
+ "learning_rate": 1.8975316640767555e-05,
886
+ "loss": 0.5245996704101562,
887
+ "step": 29500
888
+ },
889
+ {
890
+ "epoch": 0.06526115523305975,
891
+ "eval_loss": 0.4591296315193176,
892
+ "eval_runtime": 112.7915,
893
+ "eval_samples_per_second": 88.659,
894
+ "eval_steps_per_second": 5.541,
895
+ "step": 29500
896
+ },
897
+ {
898
+ "epoch": 0.06636727650819636,
899
+ "grad_norm": 4.975034236907959,
900
+ "learning_rate": 1.8940319860108816e-05,
901
+ "loss": 0.5209257202148437,
902
+ "step": 30000
903
+ },
904
+ {
905
+ "epoch": 0.06636727650819636,
906
+ "eval_loss": 0.4560508728027344,
907
+ "eval_runtime": 112.6939,
908
+ "eval_samples_per_second": 88.736,
909
+ "eval_steps_per_second": 5.546,
910
+ "step": 30000
911
+ },
912
+ {
913
+ "epoch": 0.06747339778333296,
914
+ "grad_norm": 3.36059308052063,
915
+ "learning_rate": 1.8904768830642685e-05,
916
+ "loss": 0.5198472900390625,
917
+ "step": 30500
918
+ },
919
+ {
920
+ "epoch": 0.06747339778333296,
921
+ "eval_loss": 0.4543982446193695,
922
+ "eval_runtime": 112.2284,
923
+ "eval_samples_per_second": 89.104,
924
+ "eval_steps_per_second": 5.569,
925
+ "step": 30500
926
+ },
927
+ {
928
+ "epoch": 0.06857951905846957,
929
+ "grad_norm": 4.251373291015625,
930
+ "learning_rate": 1.8868665756330093e-05,
931
+ "loss": 0.5192612915039062,
932
+ "step": 31000
933
+ },
934
+ {
935
+ "epoch": 0.06857951905846957,
936
+ "eval_loss": 0.44903045892715454,
937
+ "eval_runtime": 111.4899,
938
+ "eval_samples_per_second": 89.694,
939
+ "eval_steps_per_second": 5.606,
940
+ "step": 31000
941
+ },
942
+ {
943
+ "epoch": 0.06968564033360618,
944
+ "grad_norm": 4.051659107208252,
945
+ "learning_rate": 1.88320128753556e-05,
946
+ "loss": 0.5216185913085938,
947
+ "step": 31500
948
+ },
949
+ {
950
+ "epoch": 0.06968564033360618,
951
+ "eval_loss": 0.4525564908981323,
952
+ "eval_runtime": 112.0607,
953
+ "eval_samples_per_second": 89.237,
954
+ "eval_steps_per_second": 5.577,
955
+ "step": 31500
956
+ },
957
+ {
958
+ "epoch": 0.07079176160874279,
959
+ "grad_norm": 4.67618989944458,
960
+ "learning_rate": 1.8794812459988646e-05,
961
+ "loss": 0.507496826171875,
962
+ "step": 32000
963
+ },
964
+ {
965
+ "epoch": 0.07079176160874279,
966
+ "eval_loss": 0.45252183079719543,
967
+ "eval_runtime": 111.3402,
968
+ "eval_samples_per_second": 89.815,
969
+ "eval_steps_per_second": 5.613,
970
+ "step": 32000
971
+ },
972
+ {
973
+ "epoch": 0.07189788288387938,
974
+ "grad_norm": 2.5967023372650146,
975
+ "learning_rate": 1.8757066816442668e-05,
976
+ "loss": 0.5137508544921875,
977
+ "step": 32500
978
+ },
979
+ {
980
+ "epoch": 0.07189788288387938,
981
+ "eval_loss": 0.4464685618877411,
982
+ "eval_runtime": 112.1495,
983
+ "eval_samples_per_second": 89.167,
984
+ "eval_steps_per_second": 5.573,
985
+ "step": 32500
986
+ },
987
+ {
988
+ "epoch": 0.07300400415901599,
989
+ "grad_norm": 3.3378617763519287,
990
+ "learning_rate": 1.8718778284732152e-05,
991
+ "loss": 0.5107922058105469,
992
+ "step": 33000
993
+ },
994
+ {
995
+ "epoch": 0.07300400415901599,
996
+ "eval_loss": 0.445722371339798,
997
+ "eval_runtime": 111.8941,
998
+ "eval_samples_per_second": 89.37,
999
+ "eval_steps_per_second": 5.586,
1000
+ "step": 33000
1001
+ },
1002
+ {
1003
+ "epoch": 0.0741101254341526,
1004
+ "grad_norm": 3.411388397216797,
1005
+ "learning_rate": 1.8679949238527535e-05,
1006
+ "loss": 0.5060233154296875,
1007
+ "step": 33500
1008
+ },
1009
+ {
1010
+ "epoch": 0.0741101254341526,
1011
+ "eval_loss": 0.448230504989624,
1012
+ "eval_runtime": 111.1727,
1013
+ "eval_samples_per_second": 89.95,
1014
+ "eval_steps_per_second": 5.622,
1015
+ "step": 33500
1016
+ },
1017
+ {
1018
+ "epoch": 0.07521624670928921,
1019
+ "grad_norm": 3.030487060546875,
1020
+ "learning_rate": 1.8640582085008087e-05,
1021
+ "loss": 0.5060429992675781,
1022
+ "step": 34000
1023
+ },
1024
+ {
1025
+ "epoch": 0.07521624670928921,
1026
+ "eval_loss": 0.4455428123474121,
1027
+ "eval_runtime": 112.3533,
1028
+ "eval_samples_per_second": 89.005,
1029
+ "eval_steps_per_second": 5.563,
1030
+ "step": 34000
1031
+ },
1032
+ {
1033
+ "epoch": 0.0763223679844258,
1034
+ "grad_norm": 3.8484420776367188,
1035
+ "learning_rate": 1.8600679264712652e-05,
1036
+ "loss": 0.5075642395019532,
1037
+ "step": 34500
1038
+ },
1039
+ {
1040
+ "epoch": 0.0763223679844258,
1041
+ "eval_loss": 0.4382660984992981,
1042
+ "eval_runtime": 112.4803,
1043
+ "eval_samples_per_second": 88.904,
1044
+ "eval_steps_per_second": 5.557,
1045
+ "step": 34500
1046
+ },
1047
+ {
1048
+ "epoch": 0.07742848925956242,
1049
+ "grad_norm": 3.2480130195617676,
1050
+ "learning_rate": 1.8560243251388347e-05,
1051
+ "loss": 0.501132568359375,
1052
+ "step": 35000
1053
+ },
1054
+ {
1055
+ "epoch": 0.07742848925956242,
1056
+ "eval_loss": 0.4425552189350128,
1057
+ "eval_runtime": 111.227,
1058
+ "eval_samples_per_second": 89.906,
1059
+ "eval_steps_per_second": 5.619,
1060
+ "step": 35000
1061
+ },
1062
+ {
1063
+ "epoch": 0.07853461053469903,
1064
+ "grad_norm": 3.756162166595459,
1065
+ "learning_rate": 1.851927655183723e-05,
1066
+ "loss": 0.5018593139648437,
1067
+ "step": 35500
1068
+ },
1069
+ {
1070
+ "epoch": 0.07853461053469903,
1071
+ "eval_loss": 0.4464947283267975,
1072
+ "eval_runtime": 111.8369,
1073
+ "eval_samples_per_second": 89.416,
1074
+ "eval_steps_per_second": 5.588,
1075
+ "step": 35500
1076
+ },
1077
+ {
1078
+ "epoch": 0.07964073180983564,
1079
+ "grad_norm": 3.9083096981048584,
1080
+ "learning_rate": 1.8477781705760868e-05,
1081
+ "loss": 0.5015058898925782,
1082
+ "step": 36000
1083
+ },
1084
+ {
1085
+ "epoch": 0.07964073180983564,
1086
+ "eval_loss": 0.43595874309539795,
1087
+ "eval_runtime": 111.7205,
1088
+ "eval_samples_per_second": 89.509,
1089
+ "eval_steps_per_second": 5.594,
1090
+ "step": 36000
1091
+ },
1092
+ {
1093
+ "epoch": 0.08074685308497223,
1094
+ "grad_norm": 3.7168922424316406,
1095
+ "learning_rate": 1.84357612856029e-05,
1096
+ "loss": 0.49204946899414065,
1097
+ "step": 36500
1098
+ },
1099
+ {
1100
+ "epoch": 0.08074685308497223,
1101
+ "eval_loss": 0.435894250869751,
1102
+ "eval_runtime": 111.6128,
1103
+ "eval_samples_per_second": 89.595,
1104
+ "eval_steps_per_second": 5.6,
1105
+ "step": 36500
1106
+ },
1107
+ {
1108
+ "epoch": 0.08185297436010884,
1109
+ "grad_norm": 3.5467872619628906,
1110
+ "learning_rate": 1.839321789638955e-05,
1111
+ "loss": 0.49367572021484374,
1112
+ "step": 37000
1113
+ },
1114
+ {
1115
+ "epoch": 0.08185297436010884,
1116
+ "eval_loss": 0.43340766429901123,
1117
+ "eval_runtime": 111.3967,
1118
+ "eval_samples_per_second": 89.769,
1119
+ "eval_steps_per_second": 5.611,
1120
+ "step": 37000
1121
+ },
1122
+ {
1123
+ "epoch": 0.08295909563524545,
1124
+ "grad_norm": 3.1759660243988037,
1125
+ "learning_rate": 1.8350154175568158e-05,
1126
+ "loss": 0.49164642333984376,
1127
+ "step": 37500
1128
+ },
1129
+ {
1130
+ "epoch": 0.08295909563524545,
1131
+ "eval_loss": 0.4309427738189697,
1132
+ "eval_runtime": 111.7776,
1133
+ "eval_samples_per_second": 89.463,
1134
+ "eval_steps_per_second": 5.591,
1135
+ "step": 37500
1136
+ },
1137
+ {
1138
+ "epoch": 0.08406521691038206,
1139
+ "grad_norm": 2.551203727722168,
1140
+ "learning_rate": 1.8306572792843637e-05,
1141
+ "loss": 0.5008921813964844,
1142
+ "step": 38000
1143
+ },
1144
+ {
1145
+ "epoch": 0.08406521691038206,
1146
+ "eval_loss": 0.43083590269088745,
1147
+ "eval_runtime": 111.5917,
1148
+ "eval_samples_per_second": 89.612,
1149
+ "eval_steps_per_second": 5.601,
1150
+ "step": 38000
1151
+ },
1152
+ {
1153
+ "epoch": 0.08517133818551866,
1154
+ "grad_norm": 3.143233299255371,
1155
+ "learning_rate": 1.8262476450012997e-05,
1156
+ "loss": 0.49582595825195314,
1157
+ "step": 38500
1158
+ },
1159
+ {
1160
+ "epoch": 0.08517133818551866,
1161
+ "eval_loss": 0.4258905351161957,
1162
+ "eval_runtime": 111.0909,
1163
+ "eval_samples_per_second": 90.016,
1164
+ "eval_steps_per_second": 5.626,
1165
+ "step": 38500
1166
+ },
1167
+ {
1168
+ "epoch": 0.08627745946065526,
1169
+ "grad_norm": 3.648927927017212,
1170
+ "learning_rate": 1.8217867880797815e-05,
1171
+ "loss": 0.49535494995117185,
1172
+ "step": 39000
1173
+ },
1174
+ {
1175
+ "epoch": 0.08627745946065526,
1176
+ "eval_loss": 0.4332347512245178,
1177
+ "eval_runtime": 110.8231,
1178
+ "eval_samples_per_second": 90.234,
1179
+ "eval_steps_per_second": 5.64,
1180
+ "step": 39000
1181
+ },
1182
+ {
1183
+ "epoch": 0.08738358073579187,
1184
+ "grad_norm": 3.230006217956543,
1185
+ "learning_rate": 1.8172749850674803e-05,
1186
+ "loss": 0.4937856140136719,
1187
+ "step": 39500
1188
+ },
1189
+ {
1190
+ "epoch": 0.08738358073579187,
1191
+ "eval_loss": 0.4286055266857147,
1192
+ "eval_runtime": 112.0444,
1193
+ "eval_samples_per_second": 89.25,
1194
+ "eval_steps_per_second": 5.578,
1195
+ "step": 39500
1196
+ },
1197
+ {
1198
+ "epoch": 0.08848970201092848,
1199
+ "grad_norm": 3.8436365127563477,
1200
+ "learning_rate": 1.8127125156704334e-05,
1201
+ "loss": 0.4838755187988281,
1202
+ "step": 40000
1203
+ },
1204
+ {
1205
+ "epoch": 0.08848970201092848,
1206
+ "eval_loss": 0.4219776391983032,
1207
+ "eval_runtime": 111.1774,
1208
+ "eval_samples_per_second": 89.946,
1209
+ "eval_steps_per_second": 5.622,
1210
+ "step": 40000
1211
+ },
1212
+ {
1213
+ "epoch": 0.08959582328606508,
1214
+ "grad_norm": 4.849334716796875,
1215
+ "learning_rate": 1.8080996627357037e-05,
1216
+ "loss": 0.4815330505371094,
1217
+ "step": 40500
1218
+ },
1219
+ {
1220
+ "epoch": 0.08959582328606508,
1221
+ "eval_loss": 0.42751649022102356,
1222
+ "eval_runtime": 111.231,
1223
+ "eval_samples_per_second": 89.903,
1224
+ "eval_steps_per_second": 5.619,
1225
+ "step": 40500
1226
+ },
1227
+ {
1228
+ "epoch": 0.09070194456120169,
1229
+ "grad_norm": 2.9716176986694336,
1230
+ "learning_rate": 1.8034367122338477e-05,
1231
+ "loss": 0.4810438232421875,
1232
+ "step": 41000
1233
+ },
1234
+ {
1235
+ "epoch": 0.09070194456120169,
1236
+ "eval_loss": 0.42341557145118713,
1237
+ "eval_runtime": 110.5253,
1238
+ "eval_samples_per_second": 90.477,
1239
+ "eval_steps_per_second": 5.655,
1240
+ "step": 41000
1241
+ },
1242
+ {
1243
+ "epoch": 0.0918080658363383,
1244
+ "grad_norm": 4.334221363067627,
1245
+ "learning_rate": 1.798723953241184e-05,
1246
+ "loss": 0.4755215148925781,
1247
+ "step": 41500
1248
+ },
1249
+ {
1250
+ "epoch": 0.0918080658363383,
1251
+ "eval_loss": 0.42155927419662476,
1252
+ "eval_runtime": 112.2482,
1253
+ "eval_samples_per_second": 89.088,
1254
+ "eval_steps_per_second": 5.568,
1255
+ "step": 41500
1256
+ },
1257
+ {
1258
+ "epoch": 0.09291418711147491,
1259
+ "grad_norm": 6.2074432373046875,
1260
+ "learning_rate": 1.7939616779218728e-05,
1261
+ "loss": 0.4806861877441406,
1262
+ "step": 42000
1263
+ },
1264
+ {
1265
+ "epoch": 0.09291418711147491,
1266
+ "eval_loss": 0.4218466281890869,
1267
+ "eval_runtime": 111.7787,
1268
+ "eval_samples_per_second": 89.462,
1269
+ "eval_steps_per_second": 5.591,
1270
+ "step": 42000
1271
+ },
1272
+ {
1273
+ "epoch": 0.0940203083866115,
1274
+ "grad_norm": 3.6507174968719482,
1275
+ "learning_rate": 1.7891501815098063e-05,
1276
+ "loss": 0.4757821044921875,
1277
+ "step": 42500
1278
+ },
1279
+ {
1280
+ "epoch": 0.0940203083866115,
1281
+ "eval_loss": 0.41902461647987366,
1282
+ "eval_runtime": 111.5077,
1283
+ "eval_samples_per_second": 89.68,
1284
+ "eval_steps_per_second": 5.605,
1285
+ "step": 42500
1286
+ },
1287
+ {
1288
+ "epoch": 0.09512642966174811,
1289
+ "grad_norm": 3.918403148651123,
1290
+ "learning_rate": 1.784289762290301e-05,
1291
+ "loss": 0.4804989013671875,
1292
+ "step": 43000
1293
+ },
1294
+ {
1295
+ "epoch": 0.09512642966174811,
1296
+ "eval_loss": 0.42434442043304443,
1297
+ "eval_runtime": 111.2033,
1298
+ "eval_samples_per_second": 89.925,
1299
+ "eval_steps_per_second": 5.62,
1300
+ "step": 43000
1301
+ },
1302
+ {
1303
+ "epoch": 0.09623255093688472,
1304
+ "grad_norm": 3.1801273822784424,
1305
+ "learning_rate": 1.7793807215816095e-05,
1306
+ "loss": 0.4728958740234375,
1307
+ "step": 43500
1308
+ },
1309
+ {
1310
+ "epoch": 0.09623255093688472,
1311
+ "eval_loss": 0.4186353385448456,
1312
+ "eval_runtime": 111.5175,
1313
+ "eval_samples_per_second": 89.672,
1314
+ "eval_steps_per_second": 5.604,
1315
+ "step": 43500
1316
+ },
1317
+ {
1318
+ "epoch": 0.09733867221202133,
1319
+ "grad_norm": 3.6735751628875732,
1320
+ "learning_rate": 1.7744233637162387e-05,
1321
+ "loss": 0.4641239929199219,
1322
+ "step": 44000
1323
+ },
1324
+ {
1325
+ "epoch": 0.09733867221202133,
1326
+ "eval_loss": 0.41301777958869934,
1327
+ "eval_runtime": 110.8625,
1328
+ "eval_samples_per_second": 90.202,
1329
+ "eval_steps_per_second": 5.638,
1330
+ "step": 44000
1331
+ },
1332
+ {
1333
+ "epoch": 0.09844479348715793,
1334
+ "grad_norm": 2.789695978164673,
1335
+ "learning_rate": 1.7694179960220842e-05,
1336
+ "loss": 0.4733058166503906,
1337
+ "step": 44500
1338
+ },
1339
+ {
1340
+ "epoch": 0.09844479348715793,
1341
+ "eval_loss": 0.42087632417678833,
1342
+ "eval_runtime": 111.0363,
1343
+ "eval_samples_per_second": 90.061,
1344
+ "eval_steps_per_second": 5.629,
1345
+ "step": 44500
1346
+ },
1347
+ {
1348
+ "epoch": 0.09955091476229454,
1349
+ "grad_norm": 3.6969802379608154,
1350
+ "learning_rate": 1.7643649288033766e-05,
1351
+ "loss": 0.4693783874511719,
1352
+ "step": 45000
1353
+ },
1354
+ {
1355
+ "epoch": 0.09955091476229454,
1356
+ "eval_loss": 0.4166164994239807,
1357
+ "eval_runtime": 111.4744,
1358
+ "eval_samples_per_second": 89.707,
1359
+ "eval_steps_per_second": 5.607,
1360
+ "step": 45000
1361
+ },
1362
+ {
1363
+ "epoch": 0.10065703603743115,
1364
+ "grad_norm": 3.573570966720581,
1365
+ "learning_rate": 1.7592644753214445e-05,
1366
+ "loss": 0.4692704162597656,
1367
+ "step": 45500
1368
+ },
1369
+ {
1370
+ "epoch": 0.10065703603743115,
1371
+ "eval_loss": 0.41210126876831055,
1372
+ "eval_runtime": 111.5033,
1373
+ "eval_samples_per_second": 89.683,
1374
+ "eval_steps_per_second": 5.605,
1375
+ "step": 45500
1376
+ },
1377
+ {
1378
+ "epoch": 0.10176315731256776,
1379
+ "grad_norm": 3.356349229812622,
1380
+ "learning_rate": 1.7541169517752944e-05,
1381
+ "loss": 0.46585760498046874,
1382
+ "step": 46000
1383
+ },
1384
+ {
1385
+ "epoch": 0.10176315731256776,
1386
+ "eval_loss": 0.41443243622779846,
1387
+ "eval_runtime": 111.179,
1388
+ "eval_samples_per_second": 89.945,
1389
+ "eval_steps_per_second": 5.622,
1390
+ "step": 46000
1391
+ },
1392
+ {
1393
+ "epoch": 0.10286927858770435,
1394
+ "grad_norm": 2.9996583461761475,
1395
+ "learning_rate": 1.748922677282009e-05,
1396
+ "loss": 0.4640685119628906,
1397
+ "step": 46500
1398
+ },
1399
+ {
1400
+ "epoch": 0.10286927858770435,
1401
+ "eval_loss": 0.41033294796943665,
1402
+ "eval_runtime": 110.8113,
1403
+ "eval_samples_per_second": 90.243,
1404
+ "eval_steps_per_second": 5.64,
1405
+ "step": 46500
1406
+ },
1407
+ {
1408
+ "epoch": 0.10397539986284096,
1409
+ "grad_norm": 4.090509414672852,
1410
+ "learning_rate": 1.7436819738569617e-05,
1411
+ "loss": 0.46669842529296873,
1412
+ "step": 47000
1413
+ },
1414
+ {
1415
+ "epoch": 0.10397539986284096,
1416
+ "eval_loss": 0.4172143042087555,
1417
+ "eval_runtime": 111.5976,
1418
+ "eval_samples_per_second": 89.608,
1419
+ "eval_steps_per_second": 5.6,
1420
+ "step": 47000
1421
+ },
1422
+ {
1423
+ "epoch": 0.10508152113797757,
1424
+ "grad_norm": 3.4085447788238525,
1425
+ "learning_rate": 1.7383951663938554e-05,
1426
+ "loss": 0.46754437255859377,
1427
+ "step": 47500
1428
+ },
1429
+ {
1430
+ "epoch": 0.10508152113797757,
1431
+ "eval_loss": 0.4096528887748718,
1432
+ "eval_runtime": 110.9486,
1433
+ "eval_samples_per_second": 90.132,
1434
+ "eval_steps_per_second": 5.633,
1435
+ "step": 47500
1436
+ },
1437
+ {
1438
+ "epoch": 0.10618764241311418,
1439
+ "grad_norm": 3.7726781368255615,
1440
+ "learning_rate": 1.7330625826445803e-05,
1441
+ "loss": 0.465860107421875,
1442
+ "step": 48000
1443
+ },
1444
+ {
1445
+ "epoch": 0.10618764241311418,
1446
+ "eval_loss": 0.4105297923088074,
1447
+ "eval_runtime": 111.2199,
1448
+ "eval_samples_per_second": 89.912,
1449
+ "eval_steps_per_second": 5.619,
1450
+ "step": 48000
1451
+ },
1452
+ {
1453
+ "epoch": 0.10729376368825078,
1454
+ "grad_norm": 3.026475191116333,
1455
+ "learning_rate": 1.727684553198895e-05,
1456
+ "loss": 0.47103488159179685,
1457
+ "step": 48500
1458
+ },
1459
+ {
1460
+ "epoch": 0.10729376368825078,
1461
+ "eval_loss": 0.4050140380859375,
1462
+ "eval_runtime": 111.9615,
1463
+ "eval_samples_per_second": 89.316,
1464
+ "eval_steps_per_second": 5.582,
1465
+ "step": 48500
1466
+ },
1467
+ {
1468
+ "epoch": 0.10839988496338739,
1469
+ "grad_norm": 4.641044616699219,
1470
+ "learning_rate": 1.722261411463931e-05,
1471
+ "loss": 0.45761444091796877,
1472
+ "step": 49000
1473
+ },
1474
+ {
1475
+ "epoch": 0.10839988496338739,
1476
+ "eval_loss": 0.40581125020980835,
1477
+ "eval_runtime": 111.9255,
1478
+ "eval_samples_per_second": 89.345,
1479
+ "eval_steps_per_second": 5.584,
1480
+ "step": 49000
1481
+ },
1482
+ {
1483
+ "epoch": 0.109506006238524,
1484
+ "grad_norm": 2.750777244567871,
1485
+ "learning_rate": 1.716793493643526e-05,
1486
+ "loss": 0.45857110595703127,
1487
+ "step": 49500
1488
+ },
1489
+ {
1490
+ "epoch": 0.109506006238524,
1491
+ "eval_loss": 0.4027765989303589,
1492
+ "eval_runtime": 110.8459,
1493
+ "eval_samples_per_second": 90.215,
1494
+ "eval_steps_per_second": 5.638,
1495
+ "step": 49500
1496
+ },
1497
+ {
1498
+ "epoch": 0.11061212751366059,
1499
+ "grad_norm": 3.3473005294799805,
1500
+ "learning_rate": 1.711281138717378e-05,
1501
+ "loss": 0.4617832946777344,
1502
+ "step": 50000
1503
+ },
1504
+ {
1505
+ "epoch": 0.11061212751366059,
1506
+ "eval_loss": 0.40101996064186096,
1507
+ "eval_runtime": 111.2161,
1508
+ "eval_samples_per_second": 89.915,
1509
+ "eval_steps_per_second": 5.62,
1510
+ "step": 50000
1511
+ }
1512
+ ],
1513
+ "logging_steps": 500,
1514
+ "max_steps": 200000,
1515
+ "num_input_tokens_seen": 0,
1516
+ "num_train_epochs": 1,
1517
+ "save_steps": 500,
1518
+ "stateful_callbacks": {
1519
+ "EarlyStoppingCallback": {
1520
+ "args": {
1521
+ "early_stopping_patience": 8,
1522
+ "early_stopping_threshold": 0.0
1523
+ },
1524
+ "attributes": {
1525
+ "early_stopping_patience_counter": 0
1526
+ }
1527
+ },
1528
+ "TrainerControl": {
1529
+ "args": {
1530
+ "should_epoch_stop": false,
1531
+ "should_evaluate": false,
1532
+ "should_log": false,
1533
+ "should_save": true,
1534
+ "should_training_stop": false
1535
+ },
1536
+ "attributes": {}
1537
+ }
1538
+ },
1539
+ "total_flos": 1.055547359232e+17,
1540
+ "train_batch_size": 16,
1541
+ "trial_name": null,
1542
+ "trial_params": null
1543
+ }
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2835879e43c1b45efad4c20bb67332efa26e28b338fb07bcd82b145150d4a34a
3
+ size 4920
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/config.json ADDED
@@ -0,0 +1,39 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "DebertaV2ForMaskedLM"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": null,
7
+ "dtype": "float32",
8
+ "eos_token_id": null,
9
+ "hidden_act": "gelu",
10
+ "hidden_dropout_prob": 0.1,
11
+ "hidden_size": 768,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 3072,
14
+ "layer_norm_eps": 1e-07,
15
+ "legacy": true,
16
+ "max_position_embeddings": 512,
17
+ "max_relative_positions": -1,
18
+ "model_type": "deberta-v2",
19
+ "norm_rel_ebd": "layer_norm",
20
+ "num_attention_heads": 12,
21
+ "num_hidden_layers": 12,
22
+ "pad_token_id": 0,
23
+ "pooler_dropout": 0.0,
24
+ "pooler_hidden_act": "gelu",
25
+ "pooler_hidden_size": 768,
26
+ "pos_att_type": [
27
+ "p2c",
28
+ "c2p"
29
+ ],
30
+ "position_biased_input": false,
31
+ "position_buckets": 256,
32
+ "relative_attention": true,
33
+ "share_att_key": true,
34
+ "tie_word_embeddings": true,
35
+ "transformers_version": "5.8.0",
36
+ "type_vocab_size": 0,
37
+ "use_cache": false,
38
+ "vocab_size": 251000
39
+ }
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dbdfe1b30760d580aa798eec58c5e30cd125b12273833580d0f3e4769de6fec9
3
+ size 1116272392
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:939a73cfb41996202c75f8c694a89cb089c9ee548cb74d054a336c2b27a21560
3
+ size 2232664762
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a47722c152ea96b5bb13b6d5dc8a5be8692fa185aa3ea9255abc4475fd016f6e
3
+ size 14244
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dd0613cf7b814c79487945f28e1cbf746ed0a1a7a18ec04c4f97a0fa726daed4
3
+ size 1064
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:89ee6ed21d345eba7ad360473bde026240d8cf42fc67723b61162d9605784efa
3
+ size 16034016
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/tokenizer_config.json ADDED
@@ -0,0 +1,124 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": true,
3
+ "backend": "tokenizers",
4
+ "bos_token": "[CLS]",
5
+ "cls_token": "[CLS]",
6
+ "do_lower_case": false,
7
+ "eos_token": "[SEP]",
8
+ "extra_special_tokens": [
9
+ "[PAD]",
10
+ "[CLS]",
11
+ "[SEP]",
12
+ "▁<extra_id_99>",
13
+ "▁<extra_id_98>",
14
+ "▁<extra_id_97>",
15
+ "▁<extra_id_96>",
16
+ "▁<extra_id_95>",
17
+ "▁<extra_id_94>",
18
+ "▁<extra_id_93>",
19
+ "▁<extra_id_92>",
20
+ "▁<extra_id_91>",
21
+ "▁<extra_id_90>",
22
+ "▁<extra_id_89>",
23
+ "▁<extra_id_88>",
24
+ "▁<extra_id_87>",
25
+ "▁<extra_id_86>",
26
+ "▁<extra_id_85>",
27
+ "▁<extra_id_84>",
28
+ "▁<extra_id_83>",
29
+ "▁<extra_id_82>",
30
+ "▁<extra_id_81>",
31
+ "▁<extra_id_80>",
32
+ "▁<extra_id_79>",
33
+ "▁<extra_id_78>",
34
+ "▁<extra_id_77>",
35
+ "▁<extra_id_76>",
36
+ "▁<extra_id_75>",
37
+ "▁<extra_id_74>",
38
+ "▁<extra_id_73>",
39
+ "▁<extra_id_72>",
40
+ "▁<extra_id_71>",
41
+ "▁<extra_id_70>",
42
+ "▁<extra_id_69>",
43
+ "▁<extra_id_68>",
44
+ "▁<extra_id_67>",
45
+ "▁<extra_id_66>",
46
+ "▁<extra_id_65>",
47
+ "▁<extra_id_64>",
48
+ "▁<extra_id_63>",
49
+ "▁<extra_id_62>",
50
+ "▁<extra_id_61>",
51
+ "▁<extra_id_60>",
52
+ "▁<extra_id_59>",
53
+ "▁<extra_id_58>",
54
+ "▁<extra_id_57>",
55
+ "▁<extra_id_56>",
56
+ "▁<extra_id_55>",
57
+ "▁<extra_id_54>",
58
+ "▁<extra_id_53>",
59
+ "▁<extra_id_52>",
60
+ "▁<extra_id_51>",
61
+ "▁<extra_id_50>",
62
+ "▁<extra_id_49>",
63
+ "▁<extra_id_48>",
64
+ "▁<extra_id_47>",
65
+ "▁<extra_id_46>",
66
+ "▁<extra_id_45>",
67
+ "▁<extra_id_44>",
68
+ "▁<extra_id_43>",
69
+ "▁<extra_id_42>",
70
+ "▁<extra_id_41>",
71
+ "▁<extra_id_40>",
72
+ "▁<extra_id_39>",
73
+ "▁<extra_id_38>",
74
+ "▁<extra_id_37>",
75
+ "▁<extra_id_36>",
76
+ "▁<extra_id_35>",
77
+ "▁<extra_id_34>",
78
+ "▁<extra_id_33>",
79
+ "▁<extra_id_32>",
80
+ "▁<extra_id_31>",
81
+ "▁<extra_id_30>",
82
+ "▁<extra_id_29>",
83
+ "▁<extra_id_28>",
84
+ "▁<extra_id_27>",
85
+ "▁<extra_id_26>",
86
+ "▁<extra_id_25>",
87
+ "▁<extra_id_24>",
88
+ "▁<extra_id_23>",
89
+ "▁<extra_id_22>",
90
+ "▁<extra_id_21>",
91
+ "▁<extra_id_20>",
92
+ "▁<extra_id_19>",
93
+ "▁<extra_id_18>",
94
+ "▁<extra_id_17>",
95
+ "▁<extra_id_16>",
96
+ "▁<extra_id_15>",
97
+ "▁<extra_id_14>",
98
+ "▁<extra_id_13>",
99
+ "▁<extra_id_12>",
100
+ "▁<extra_id_11>",
101
+ "▁<extra_id_10>",
102
+ "▁<extra_id_9>",
103
+ "▁<extra_id_8>",
104
+ "▁<extra_id_7>",
105
+ "▁<extra_id_6>",
106
+ "▁<extra_id_5>",
107
+ "▁<extra_id_4>",
108
+ "▁<extra_id_3>",
109
+ "▁<extra_id_2>",
110
+ "▁<extra_id_1>",
111
+ "▁<extra_id_0>"
112
+ ],
113
+ "is_local": false,
114
+ "local_files_only": false,
115
+ "mask_token": "[MASK]",
116
+ "model_max_length": 1000000000000000019884624838656,
117
+ "pad_token": "[PAD]",
118
+ "sep_token": "[SEP]",
119
+ "split_by_punct": false,
120
+ "tokenizer_class": "DebertaV2Tokenizer",
121
+ "unk_id": 3,
122
+ "unk_token": "[UNK]",
123
+ "vocab_type": "spm"
124
+ }
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/trainer_state.json ADDED
@@ -0,0 +1,1558 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 50000,
3
+ "best_metric": 0.40101996064186096,
4
+ "best_model_checkpoint": "pretrained_checkpoints/microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50000",
5
+ "epoch": 0.1117182487887972,
6
+ "eval_steps": 500,
7
+ "global_step": 50500,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.001106121275136606,
14
+ "grad_norm": 5.109910488128662,
15
+ "learning_rate": 1.9960000000000002e-05,
16
+ "loss": 0.7441332397460938,
17
+ "step": 500
18
+ },
19
+ {
20
+ "epoch": 0.001106121275136606,
21
+ "eval_loss": 0.6986047029495239,
22
+ "eval_runtime": 112.6243,
23
+ "eval_samples_per_second": 88.791,
24
+ "eval_steps_per_second": 5.549,
25
+ "step": 500
26
+ },
27
+ {
28
+ "epoch": 0.002212242550273212,
29
+ "grad_norm": 4.430311679840088,
30
+ "learning_rate": 1.9999691267175455e-05,
31
+ "loss": 0.7207266235351563,
32
+ "step": 1000
33
+ },
34
+ {
35
+ "epoch": 0.002212242550273212,
36
+ "eval_loss": 0.7042032480239868,
37
+ "eval_runtime": 113.1343,
38
+ "eval_samples_per_second": 88.39,
39
+ "eval_steps_per_second": 5.524,
40
+ "step": 1000
41
+ },
42
+ {
43
+ "epoch": 0.003318363825409818,
44
+ "grad_norm": 4.777109146118164,
45
+ "learning_rate": 1.999876261180218e-05,
46
+ "loss": 0.7199944458007812,
47
+ "step": 1500
48
+ },
49
+ {
50
+ "epoch": 0.003318363825409818,
51
+ "eval_loss": 0.6881175637245178,
52
+ "eval_runtime": 113.2438,
53
+ "eval_samples_per_second": 88.305,
54
+ "eval_steps_per_second": 5.519,
55
+ "step": 1500
56
+ },
57
+ {
58
+ "epoch": 0.004424485100546424,
59
+ "grad_norm": 5.561853885650635,
60
+ "learning_rate": 1.9997214090211625e-05,
61
+ "loss": 0.7080358276367188,
62
+ "step": 2000
63
+ },
64
+ {
65
+ "epoch": 0.004424485100546424,
66
+ "eval_loss": 0.6904817223548889,
67
+ "eval_runtime": 112.7945,
68
+ "eval_samples_per_second": 88.657,
69
+ "eval_steps_per_second": 5.541,
70
+ "step": 2000
71
+ },
72
+ {
73
+ "epoch": 0.00553060637568303,
74
+ "grad_norm": 6.21124267578125,
75
+ "learning_rate": 1.999504579840329e-05,
76
+ "loss": 0.6967091064453125,
77
+ "step": 2500
78
+ },
79
+ {
80
+ "epoch": 0.00553060637568303,
81
+ "eval_loss": 0.6767826676368713,
82
+ "eval_runtime": 113.0443,
83
+ "eval_samples_per_second": 88.461,
84
+ "eval_steps_per_second": 5.529,
85
+ "step": 2500
86
+ },
87
+ {
88
+ "epoch": 0.006636727650819636,
89
+ "grad_norm": 5.691308975219727,
90
+ "learning_rate": 1.999225787079888e-05,
91
+ "loss": 0.6900145874023438,
92
+ "step": 3000
93
+ },
94
+ {
95
+ "epoch": 0.006636727650819636,
96
+ "eval_loss": 0.6694205403327942,
97
+ "eval_runtime": 112.5418,
98
+ "eval_samples_per_second": 88.856,
99
+ "eval_steps_per_second": 5.553,
100
+ "step": 3000
101
+ },
102
+ {
103
+ "epoch": 0.0077428489259562415,
104
+ "grad_norm": 4.682841777801514,
105
+ "learning_rate": 1.998885048023401e-05,
106
+ "loss": 0.6884268188476562,
107
+ "step": 3500
108
+ },
109
+ {
110
+ "epoch": 0.0077428489259562415,
111
+ "eval_loss": 0.6560861468315125,
112
+ "eval_runtime": 112.6375,
113
+ "eval_samples_per_second": 88.78,
114
+ "eval_steps_per_second": 5.549,
115
+ "step": 3500
116
+ },
117
+ {
118
+ "epoch": 0.008848970201092848,
119
+ "grad_norm": 5.647264003753662,
120
+ "learning_rate": 1.9984823837947447e-05,
121
+ "loss": 0.682076904296875,
122
+ "step": 4000
123
+ },
124
+ {
125
+ "epoch": 0.008848970201092848,
126
+ "eval_loss": 0.6438227295875549,
127
+ "eval_runtime": 112.6746,
128
+ "eval_samples_per_second": 88.751,
129
+ "eval_steps_per_second": 5.547,
130
+ "step": 4000
131
+ },
132
+ {
133
+ "epoch": 0.009955091476229454,
134
+ "grad_norm": 5.628658771514893,
135
+ "learning_rate": 1.9980178193568023e-05,
136
+ "loss": 0.68534716796875,
137
+ "step": 4500
138
+ },
139
+ {
140
+ "epoch": 0.009955091476229454,
141
+ "eval_loss": 0.6456083059310913,
142
+ "eval_runtime": 112.6856,
143
+ "eval_samples_per_second": 88.742,
144
+ "eval_steps_per_second": 5.546,
145
+ "step": 4500
146
+ },
147
+ {
148
+ "epoch": 0.01106121275136606,
149
+ "grad_norm": 5.811315536499023,
150
+ "learning_rate": 1.9974913835099184e-05,
151
+ "loss": 0.6908584594726562,
152
+ "step": 5000
153
+ },
154
+ {
155
+ "epoch": 0.01106121275136606,
156
+ "eval_loss": 0.6402322053909302,
157
+ "eval_runtime": 113.0924,
158
+ "eval_samples_per_second": 88.423,
159
+ "eval_steps_per_second": 5.526,
160
+ "step": 5000
161
+ },
162
+ {
163
+ "epoch": 0.012167334026502667,
164
+ "grad_norm": 4.805266380310059,
165
+ "learning_rate": 1.9969031088901108e-05,
166
+ "loss": 0.6857374267578125,
167
+ "step": 5500
168
+ },
169
+ {
170
+ "epoch": 0.012167334026502667,
171
+ "eval_loss": 0.6263570785522461,
172
+ "eval_runtime": 113.3489,
173
+ "eval_samples_per_second": 88.223,
174
+ "eval_steps_per_second": 5.514,
175
+ "step": 5500
176
+ },
177
+ {
178
+ "epoch": 0.013273455301639273,
179
+ "grad_norm": 4.605637550354004,
180
+ "learning_rate": 1.9962530319670484e-05,
181
+ "loss": 0.687199462890625,
182
+ "step": 6000
183
+ },
184
+ {
185
+ "epoch": 0.013273455301639273,
186
+ "eval_loss": 0.6212612390518188,
187
+ "eval_runtime": 112.444,
188
+ "eval_samples_per_second": 88.933,
189
+ "eval_steps_per_second": 5.558,
190
+ "step": 6000
191
+ },
192
+ {
193
+ "epoch": 0.014379576576775877,
194
+ "grad_norm": 5.917664051055908,
195
+ "learning_rate": 1.9955411930417905e-05,
196
+ "loss": 0.6913502197265625,
197
+ "step": 6500
198
+ },
199
+ {
200
+ "epoch": 0.014379576576775877,
201
+ "eval_loss": 0.6166144013404846,
202
+ "eval_runtime": 113.2331,
203
+ "eval_samples_per_second": 88.313,
204
+ "eval_steps_per_second": 5.52,
205
+ "step": 6500
206
+ },
207
+ {
208
+ "epoch": 0.015485697851912483,
209
+ "grad_norm": 5.986708641052246,
210
+ "learning_rate": 1.994767636244288e-05,
211
+ "loss": 0.681802001953125,
212
+ "step": 7000
213
+ },
214
+ {
215
+ "epoch": 0.015485697851912483,
216
+ "eval_loss": 0.6170685887336731,
217
+ "eval_runtime": 112.4446,
218
+ "eval_samples_per_second": 88.933,
219
+ "eval_steps_per_second": 5.558,
220
+ "step": 7000
221
+ },
222
+ {
223
+ "epoch": 0.01659181912704909,
224
+ "grad_norm": 5.719727516174316,
225
+ "learning_rate": 1.9939324095306473e-05,
226
+ "loss": 0.683607666015625,
227
+ "step": 7500
228
+ },
229
+ {
230
+ "epoch": 0.01659181912704909,
231
+ "eval_loss": 0.6028082370758057,
232
+ "eval_runtime": 111.9443,
233
+ "eval_samples_per_second": 89.33,
234
+ "eval_steps_per_second": 5.583,
235
+ "step": 7500
236
+ },
237
+ {
238
+ "epoch": 0.017697940402185697,
239
+ "grad_norm": 4.734459400177002,
240
+ "learning_rate": 1.9930355646801577e-05,
241
+ "loss": 0.6903638916015625,
242
+ "step": 8000
243
+ },
244
+ {
245
+ "epoch": 0.017697940402185697,
246
+ "eval_loss": 0.5941663980484009,
247
+ "eval_runtime": 112.5492,
248
+ "eval_samples_per_second": 88.85,
249
+ "eval_steps_per_second": 5.553,
250
+ "step": 8000
251
+ },
252
+ {
253
+ "epoch": 0.018804061677322303,
254
+ "grad_norm": 4.0714111328125,
255
+ "learning_rate": 1.992077157292082e-05,
256
+ "loss": 0.6867118530273437,
257
+ "step": 8500
258
+ },
259
+ {
260
+ "epoch": 0.018804061677322303,
261
+ "eval_loss": 0.5876705050468445,
262
+ "eval_runtime": 112.7258,
263
+ "eval_samples_per_second": 88.711,
264
+ "eval_steps_per_second": 5.544,
265
+ "step": 8500
266
+ },
267
+ {
268
+ "epoch": 0.01991018295245891,
269
+ "grad_norm": 4.817986965179443,
270
+ "learning_rate": 1.991057246782208e-05,
271
+ "loss": 0.6845618286132813,
272
+ "step": 9000
273
+ },
274
+ {
275
+ "epoch": 0.01991018295245891,
276
+ "eval_loss": 0.5870856642723083,
277
+ "eval_runtime": 112.4215,
278
+ "eval_samples_per_second": 88.951,
279
+ "eval_steps_per_second": 5.559,
280
+ "step": 9000
281
+ },
282
+ {
283
+ "epoch": 0.021016304227595515,
284
+ "grad_norm": 5.057409763336182,
285
+ "learning_rate": 1.989975896379167e-05,
286
+ "loss": 0.6727237548828126,
287
+ "step": 9500
288
+ },
289
+ {
290
+ "epoch": 0.021016304227595515,
291
+ "eval_loss": 0.5813655853271484,
292
+ "eval_runtime": 112.6353,
293
+ "eval_samples_per_second": 88.782,
294
+ "eval_steps_per_second": 5.549,
295
+ "step": 9500
296
+ },
297
+ {
298
+ "epoch": 0.02212242550273212,
299
+ "grad_norm": 4.090648174285889,
300
+ "learning_rate": 1.9888331731205117e-05,
301
+ "loss": 0.6655429077148437,
302
+ "step": 10000
303
+ },
304
+ {
305
+ "epoch": 0.02212242550273212,
306
+ "eval_loss": 0.5734274387359619,
307
+ "eval_runtime": 112.9725,
308
+ "eval_samples_per_second": 88.517,
309
+ "eval_steps_per_second": 5.532,
310
+ "step": 10000
311
+ },
312
+ {
313
+ "epoch": 0.023228546777868727,
314
+ "grad_norm": 4.4758148193359375,
315
+ "learning_rate": 1.9876291478485632e-05,
316
+ "loss": 0.6645328979492188,
317
+ "step": 10500
318
+ },
319
+ {
320
+ "epoch": 0.023228546777868727,
321
+ "eval_loss": 0.5689971446990967,
322
+ "eval_runtime": 112.1723,
323
+ "eval_samples_per_second": 89.149,
324
+ "eval_steps_per_second": 5.572,
325
+ "step": 10500
326
+ },
327
+ {
328
+ "epoch": 0.024334668053005333,
329
+ "grad_norm": 4.342129707336426,
330
+ "learning_rate": 1.9863638952060165e-05,
331
+ "loss": 0.6613389892578125,
332
+ "step": 11000
333
+ },
334
+ {
335
+ "epoch": 0.024334668053005333,
336
+ "eval_loss": 0.5666700005531311,
337
+ "eval_runtime": 112.6281,
338
+ "eval_samples_per_second": 88.788,
339
+ "eval_steps_per_second": 5.549,
340
+ "step": 11000
341
+ },
342
+ {
343
+ "epoch": 0.02544078932814194,
344
+ "grad_norm": 4.324596405029297,
345
+ "learning_rate": 1.9850374936313145e-05,
346
+ "loss": 0.6489639892578125,
347
+ "step": 11500
348
+ },
349
+ {
350
+ "epoch": 0.02544078932814194,
351
+ "eval_loss": 0.5580319166183472,
352
+ "eval_runtime": 113.0466,
353
+ "eval_samples_per_second": 88.459,
354
+ "eval_steps_per_second": 5.529,
355
+ "step": 11500
356
+ },
357
+ {
358
+ "epoch": 0.026546910603278545,
359
+ "grad_norm": 3.868192434310913,
360
+ "learning_rate": 1.9836500253537848e-05,
361
+ "loss": 0.651514892578125,
362
+ "step": 12000
363
+ },
364
+ {
365
+ "epoch": 0.026546910603278545,
366
+ "eval_loss": 0.5508246421813965,
367
+ "eval_runtime": 113.0398,
368
+ "eval_samples_per_second": 88.464,
369
+ "eval_steps_per_second": 5.529,
370
+ "step": 12000
371
+ },
372
+ {
373
+ "epoch": 0.027653031878415148,
374
+ "grad_norm": 4.028125762939453,
375
+ "learning_rate": 1.9822015763885417e-05,
376
+ "loss": 0.6445519409179687,
377
+ "step": 12500
378
+ },
379
+ {
380
+ "epoch": 0.027653031878415148,
381
+ "eval_loss": 0.5496281385421753,
382
+ "eval_runtime": 113.2586,
383
+ "eval_samples_per_second": 88.294,
384
+ "eval_steps_per_second": 5.518,
385
+ "step": 12500
386
+ },
387
+ {
388
+ "epoch": 0.028759153153551754,
389
+ "grad_norm": 4.765957355499268,
390
+ "learning_rate": 1.9806922365311553e-05,
391
+ "loss": 0.6352955322265625,
392
+ "step": 13000
393
+ },
394
+ {
395
+ "epoch": 0.028759153153551754,
396
+ "eval_loss": 0.5461284518241882,
397
+ "eval_runtime": 112.1974,
398
+ "eval_samples_per_second": 89.129,
399
+ "eval_steps_per_second": 5.571,
400
+ "step": 13000
401
+ },
402
+ {
403
+ "epoch": 0.02986527442868836,
404
+ "grad_norm": 4.099660873413086,
405
+ "learning_rate": 1.979122099352082e-05,
406
+ "loss": 0.6299137573242187,
407
+ "step": 13500
408
+ },
409
+ {
410
+ "epoch": 0.02986527442868836,
411
+ "eval_loss": 0.5498659610748291,
412
+ "eval_runtime": 111.8065,
413
+ "eval_samples_per_second": 89.44,
414
+ "eval_steps_per_second": 5.59,
415
+ "step": 13500
416
+ },
417
+ {
418
+ "epoch": 0.030971395703824966,
419
+ "grad_norm": 4.601438045501709,
420
+ "learning_rate": 1.9774912621908665e-05,
421
+ "loss": 0.6282794189453125,
422
+ "step": 14000
423
+ },
424
+ {
425
+ "epoch": 0.030971395703824966,
426
+ "eval_loss": 0.541534960269928,
427
+ "eval_runtime": 111.9289,
428
+ "eval_samples_per_second": 89.342,
429
+ "eval_steps_per_second": 5.584,
430
+ "step": 14000
431
+ },
432
+ {
433
+ "epoch": 0.03207751697896157,
434
+ "grad_norm": 5.145658493041992,
435
+ "learning_rate": 1.9757998261501047e-05,
436
+ "loss": 0.6148015747070312,
437
+ "step": 14500
438
+ },
439
+ {
440
+ "epoch": 0.03207751697896157,
441
+ "eval_loss": 0.5281656980514526,
442
+ "eval_runtime": 111.8633,
443
+ "eval_samples_per_second": 89.395,
444
+ "eval_steps_per_second": 5.587,
445
+ "step": 14500
446
+ },
447
+ {
448
+ "epoch": 0.03318363825409818,
449
+ "grad_norm": 4.646543979644775,
450
+ "learning_rate": 1.9740478960891782e-05,
451
+ "loss": 0.6079625854492188,
452
+ "step": 15000
453
+ },
454
+ {
455
+ "epoch": 0.03318363825409818,
456
+ "eval_loss": 0.5313529372215271,
457
+ "eval_runtime": 112.1519,
458
+ "eval_samples_per_second": 89.165,
459
+ "eval_steps_per_second": 5.573,
460
+ "step": 15000
461
+ },
462
+ {
463
+ "epoch": 0.034289759529234784,
464
+ "grad_norm": 4.390852928161621,
465
+ "learning_rate": 1.972235580617752e-05,
466
+ "loss": 0.6054973754882812,
467
+ "step": 15500
468
+ },
469
+ {
470
+ "epoch": 0.034289759529234784,
471
+ "eval_loss": 0.5350580811500549,
472
+ "eval_runtime": 113.7911,
473
+ "eval_samples_per_second": 87.88,
474
+ "eval_steps_per_second": 5.493,
475
+ "step": 15500
476
+ },
477
+ {
478
+ "epoch": 0.035395880804371394,
479
+ "grad_norm": 4.278556823730469,
480
+ "learning_rate": 1.970362992089042e-05,
481
+ "loss": 0.6086318969726563,
482
+ "step": 16000
483
+ },
484
+ {
485
+ "epoch": 0.035395880804371394,
486
+ "eval_loss": 0.5248209238052368,
487
+ "eval_runtime": 112.3769,
488
+ "eval_samples_per_second": 88.986,
489
+ "eval_steps_per_second": 5.562,
490
+ "step": 16000
491
+ },
492
+ {
493
+ "epoch": 0.036502002079507996,
494
+ "grad_norm": 4.178222179412842,
495
+ "learning_rate": 1.96843024659285e-05,
496
+ "loss": 0.6051075439453125,
497
+ "step": 16500
498
+ },
499
+ {
500
+ "epoch": 0.036502002079507996,
501
+ "eval_loss": 0.5181564092636108,
502
+ "eval_runtime": 112.438,
503
+ "eval_samples_per_second": 88.938,
504
+ "eval_steps_per_second": 5.559,
505
+ "step": 16500
506
+ },
507
+ {
508
+ "epoch": 0.037608123354644606,
509
+ "grad_norm": 3.8288681507110596,
510
+ "learning_rate": 1.9664374639483664e-05,
511
+ "loss": 0.5989437255859374,
512
+ "step": 17000
513
+ },
514
+ {
515
+ "epoch": 0.037608123354644606,
516
+ "eval_loss": 0.521802544593811,
517
+ "eval_runtime": 112.6381,
518
+ "eval_samples_per_second": 88.78,
519
+ "eval_steps_per_second": 5.549,
520
+ "step": 17000
521
+ },
522
+ {
523
+ "epoch": 0.03871424462978121,
524
+ "grad_norm": 3.432649612426758,
525
+ "learning_rate": 1.964384767696742e-05,
526
+ "loss": 0.6005252075195312,
527
+ "step": 17500
528
+ },
529
+ {
530
+ "epoch": 0.03871424462978121,
531
+ "eval_loss": 0.5095081329345703,
532
+ "eval_runtime": 112.255,
533
+ "eval_samples_per_second": 89.083,
534
+ "eval_steps_per_second": 5.568,
535
+ "step": 17500
536
+ },
537
+ {
538
+ "epoch": 0.03982036590491782,
539
+ "grad_norm": 4.271261692047119,
540
+ "learning_rate": 1.962272285093429e-05,
541
+ "loss": 0.58925830078125,
542
+ "step": 18000
543
+ },
544
+ {
545
+ "epoch": 0.03982036590491782,
546
+ "eval_loss": 0.5169823169708252,
547
+ "eval_runtime": 111.6701,
548
+ "eval_samples_per_second": 89.55,
549
+ "eval_steps_per_second": 5.597,
550
+ "step": 18000
551
+ },
552
+ {
553
+ "epoch": 0.04092648718005442,
554
+ "grad_norm": 3.561911106109619,
555
+ "learning_rate": 1.960100147100293e-05,
556
+ "loss": 0.58902587890625,
557
+ "step": 18500
558
+ },
559
+ {
560
+ "epoch": 0.04092648718005442,
561
+ "eval_loss": 0.5074495673179626,
562
+ "eval_runtime": 112.1639,
563
+ "eval_samples_per_second": 89.155,
564
+ "eval_steps_per_second": 5.572,
565
+ "step": 18500
566
+ },
567
+ {
568
+ "epoch": 0.04203260845519103,
569
+ "grad_norm": 3.64815616607666,
570
+ "learning_rate": 1.9578684883774925e-05,
571
+ "loss": 0.5864580688476563,
572
+ "step": 19000
573
+ },
574
+ {
575
+ "epoch": 0.04203260845519103,
576
+ "eval_loss": 0.5057380199432373,
577
+ "eval_runtime": 113.2061,
578
+ "eval_samples_per_second": 88.334,
579
+ "eval_steps_per_second": 5.521,
580
+ "step": 19000
581
+ },
582
+ {
583
+ "epoch": 0.04313872973032763,
584
+ "grad_norm": 4.534627437591553,
585
+ "learning_rate": 1.9555774472751313e-05,
586
+ "loss": 0.5786356811523438,
587
+ "step": 19500
588
+ },
589
+ {
590
+ "epoch": 0.04313872973032763,
591
+ "eval_loss": 0.5002171397209167,
592
+ "eval_runtime": 111.5667,
593
+ "eval_samples_per_second": 89.633,
594
+ "eval_steps_per_second": 5.602,
595
+ "step": 19500
596
+ },
597
+ {
598
+ "epoch": 0.04424485100546424,
599
+ "grad_norm": 4.598667144775391,
600
+ "learning_rate": 1.9532271658246834e-05,
601
+ "loss": 0.572388427734375,
602
+ "step": 20000
603
+ },
604
+ {
605
+ "epoch": 0.04424485100546424,
606
+ "eval_loss": 0.495422899723053,
607
+ "eval_runtime": 112.3374,
608
+ "eval_samples_per_second": 89.018,
609
+ "eval_steps_per_second": 5.564,
610
+ "step": 20000
611
+ },
612
+ {
613
+ "epoch": 0.045350972280600844,
614
+ "grad_norm": 3.4895408153533936,
615
+ "learning_rate": 1.9508177897301847e-05,
616
+ "loss": 0.5747387084960938,
617
+ "step": 20500
618
+ },
619
+ {
620
+ "epoch": 0.045350972280600844,
621
+ "eval_loss": 0.4933762550354004,
622
+ "eval_runtime": 111.8998,
623
+ "eval_samples_per_second": 89.366,
624
+ "eval_steps_per_second": 5.585,
625
+ "step": 20500
626
+ },
627
+ {
628
+ "epoch": 0.046457093555737454,
629
+ "grad_norm": 3.8103654384613037,
630
+ "learning_rate": 1.9483494683592022e-05,
631
+ "loss": 0.5658125610351562,
632
+ "step": 21000
633
+ },
634
+ {
635
+ "epoch": 0.046457093555737454,
636
+ "eval_loss": 0.49491196870803833,
637
+ "eval_runtime": 111.4759,
638
+ "eval_samples_per_second": 89.706,
639
+ "eval_steps_per_second": 5.607,
640
+ "step": 21000
641
+ },
642
+ {
643
+ "epoch": 0.04756321483087406,
644
+ "grad_norm": 3.7526588439941406,
645
+ "learning_rate": 1.9458223547335746e-05,
646
+ "loss": 0.563939453125,
647
+ "step": 21500
648
+ },
649
+ {
650
+ "epoch": 0.04756321483087406,
651
+ "eval_loss": 0.4922999143600464,
652
+ "eval_runtime": 112.4782,
653
+ "eval_samples_per_second": 88.906,
654
+ "eval_steps_per_second": 5.557,
655
+ "step": 21500
656
+ },
657
+ {
658
+ "epoch": 0.048669336106010666,
659
+ "grad_norm": 3.5741498470306396,
660
+ "learning_rate": 1.943236605519923e-05,
661
+ "loss": 0.5666294555664062,
662
+ "step": 22000
663
+ },
664
+ {
665
+ "epoch": 0.048669336106010666,
666
+ "eval_loss": 0.49273720383644104,
667
+ "eval_runtime": 112.8352,
668
+ "eval_samples_per_second": 88.625,
669
+ "eval_steps_per_second": 5.539,
670
+ "step": 22000
671
+ },
672
+ {
673
+ "epoch": 0.04977545738114727,
674
+ "grad_norm": 3.897984266281128,
675
+ "learning_rate": 1.9405923810199418e-05,
676
+ "loss": 0.5635711669921875,
677
+ "step": 22500
678
+ },
679
+ {
680
+ "epoch": 0.04977545738114727,
681
+ "eval_loss": 0.48471200466156006,
682
+ "eval_runtime": 111.5955,
683
+ "eval_samples_per_second": 89.609,
684
+ "eval_steps_per_second": 5.601,
685
+ "step": 22500
686
+ },
687
+ {
688
+ "epoch": 0.05088157865628388,
689
+ "grad_norm": 4.313111305236816,
690
+ "learning_rate": 1.9378898451604587e-05,
691
+ "loss": 0.5571904907226563,
692
+ "step": 23000
693
+ },
694
+ {
695
+ "epoch": 0.05088157865628388,
696
+ "eval_loss": 0.4867466390132904,
697
+ "eval_runtime": 112.4813,
698
+ "eval_samples_per_second": 88.904,
699
+ "eval_steps_per_second": 5.556,
700
+ "step": 23000
701
+ },
702
+ {
703
+ "epoch": 0.05198769993142048,
704
+ "grad_norm": 3.905113458633423,
705
+ "learning_rate": 1.935129165483274e-05,
706
+ "loss": 0.5491801147460937,
707
+ "step": 23500
708
+ },
709
+ {
710
+ "epoch": 0.05198769993142048,
711
+ "eval_loss": 0.4905949831008911,
712
+ "eval_runtime": 112.4885,
713
+ "eval_samples_per_second": 88.898,
714
+ "eval_steps_per_second": 5.556,
715
+ "step": 23500
716
+ },
717
+ {
718
+ "epoch": 0.05309382120655709,
719
+ "grad_norm": 4.165647983551025,
720
+ "learning_rate": 1.932310513134771e-05,
721
+ "loss": 0.5534236450195312,
722
+ "step": 24000
723
+ },
724
+ {
725
+ "epoch": 0.05309382120655709,
726
+ "eval_loss": 0.4770846664905548,
727
+ "eval_runtime": 112.5119,
728
+ "eval_samples_per_second": 88.879,
729
+ "eval_steps_per_second": 5.555,
730
+ "step": 24000
731
+ },
732
+ {
733
+ "epoch": 0.05419994248169369,
734
+ "grad_norm": 3.8773398399353027,
735
+ "learning_rate": 1.9294340628553093e-05,
736
+ "loss": 0.5511622924804688,
737
+ "step": 24500
738
+ },
739
+ {
740
+ "epoch": 0.05419994248169369,
741
+ "eval_loss": 0.4724074602127075,
742
+ "eval_runtime": 112.4911,
743
+ "eval_samples_per_second": 88.896,
744
+ "eval_steps_per_second": 5.556,
745
+ "step": 24500
746
+ },
747
+ {
748
+ "epoch": 0.055306063756830295,
749
+ "grad_norm": 4.676408767700195,
750
+ "learning_rate": 1.9264999929683895e-05,
751
+ "loss": 0.5429652709960937,
752
+ "step": 25000
753
+ },
754
+ {
755
+ "epoch": 0.055306063756830295,
756
+ "eval_loss": 0.4698111414909363,
757
+ "eval_runtime": 113.1395,
758
+ "eval_samples_per_second": 88.386,
759
+ "eval_steps_per_second": 5.524,
760
+ "step": 25000
761
+ },
762
+ {
763
+ "epoch": 0.056412185031966905,
764
+ "grad_norm": 4.590200424194336,
765
+ "learning_rate": 1.9235084853695998e-05,
766
+ "loss": 0.5434938354492187,
767
+ "step": 25500
768
+ },
769
+ {
770
+ "epoch": 0.056412185031966905,
771
+ "eval_loss": 0.4745750427246094,
772
+ "eval_runtime": 112.4034,
773
+ "eval_samples_per_second": 88.965,
774
+ "eval_steps_per_second": 5.56,
775
+ "step": 25500
776
+ },
777
+ {
778
+ "epoch": 0.05751830630710351,
779
+ "grad_norm": 3.6507468223571777,
780
+ "learning_rate": 1.920459725515338e-05,
781
+ "loss": 0.5387776489257813,
782
+ "step": 26000
783
+ },
784
+ {
785
+ "epoch": 0.05751830630710351,
786
+ "eval_loss": 0.4783058166503906,
787
+ "eval_runtime": 112.4433,
788
+ "eval_samples_per_second": 88.934,
789
+ "eval_steps_per_second": 5.558,
790
+ "step": 26000
791
+ },
792
+ {
793
+ "epoch": 0.05862442758224012,
794
+ "grad_norm": 4.008069038391113,
795
+ "learning_rate": 1.917353902411315e-05,
796
+ "loss": 0.543491455078125,
797
+ "step": 26500
798
+ },
799
+ {
800
+ "epoch": 0.05862442758224012,
801
+ "eval_loss": 0.4737086892127991,
802
+ "eval_runtime": 112.6279,
803
+ "eval_samples_per_second": 88.788,
804
+ "eval_steps_per_second": 5.549,
805
+ "step": 26500
806
+ },
807
+ {
808
+ "epoch": 0.05973054885737672,
809
+ "grad_norm": 5.477914810180664,
810
+ "learning_rate": 1.9141912086008383e-05,
811
+ "loss": 0.5376876220703125,
812
+ "step": 27000
813
+ },
814
+ {
815
+ "epoch": 0.05973054885737672,
816
+ "eval_loss": 0.4720275402069092,
817
+ "eval_runtime": 111.9032,
818
+ "eval_samples_per_second": 89.363,
819
+ "eval_steps_per_second": 5.585,
820
+ "step": 27000
821
+ },
822
+ {
823
+ "epoch": 0.06083667013251333,
824
+ "grad_norm": 3.8908817768096924,
825
+ "learning_rate": 1.9109718401528742e-05,
826
+ "loss": 0.5346746215820313,
827
+ "step": 27500
828
+ },
829
+ {
830
+ "epoch": 0.06083667013251333,
831
+ "eval_loss": 0.46936094760894775,
832
+ "eval_runtime": 114.3673,
833
+ "eval_samples_per_second": 87.438,
834
+ "eval_steps_per_second": 5.465,
835
+ "step": 27500
836
+ },
837
+ {
838
+ "epoch": 0.06194279140764993,
839
+ "grad_norm": 5.77609920501709,
840
+ "learning_rate": 1.907695996649892e-05,
841
+ "loss": 0.5293397827148437,
842
+ "step": 28000
843
+ },
844
+ {
845
+ "epoch": 0.06194279140764993,
846
+ "eval_loss": 0.47076907753944397,
847
+ "eval_runtime": 112.4252,
848
+ "eval_samples_per_second": 88.948,
849
+ "eval_steps_per_second": 5.559,
850
+ "step": 28000
851
+ },
852
+ {
853
+ "epoch": 0.06304891268278653,
854
+ "grad_norm": 3.0727529525756836,
855
+ "learning_rate": 1.9043638811754942e-05,
856
+ "loss": 0.5365479125976562,
857
+ "step": 28500
858
+ },
859
+ {
860
+ "epoch": 0.06304891268278653,
861
+ "eval_loss": 0.4585624635219574,
862
+ "eval_runtime": 112.8923,
863
+ "eval_samples_per_second": 88.58,
864
+ "eval_steps_per_second": 5.536,
865
+ "step": 28500
866
+ },
867
+ {
868
+ "epoch": 0.06415503395792314,
869
+ "grad_norm": 4.541342258453369,
870
+ "learning_rate": 1.900975700301823e-05,
871
+ "loss": 0.526941162109375,
872
+ "step": 29000
873
+ },
874
+ {
875
+ "epoch": 0.06415503395792314,
876
+ "eval_loss": 0.4596991240978241,
877
+ "eval_runtime": 112.2872,
878
+ "eval_samples_per_second": 89.057,
879
+ "eval_steps_per_second": 5.566,
880
+ "step": 29000
881
+ },
882
+ {
883
+ "epoch": 0.06526115523305975,
884
+ "grad_norm": 3.3814268112182617,
885
+ "learning_rate": 1.8975316640767555e-05,
886
+ "loss": 0.5245996704101562,
887
+ "step": 29500
888
+ },
889
+ {
890
+ "epoch": 0.06526115523305975,
891
+ "eval_loss": 0.4591296315193176,
892
+ "eval_runtime": 112.7915,
893
+ "eval_samples_per_second": 88.659,
894
+ "eval_steps_per_second": 5.541,
895
+ "step": 29500
896
+ },
897
+ {
898
+ "epoch": 0.06636727650819636,
899
+ "grad_norm": 4.975034236907959,
900
+ "learning_rate": 1.8940319860108816e-05,
901
+ "loss": 0.5209257202148437,
902
+ "step": 30000
903
+ },
904
+ {
905
+ "epoch": 0.06636727650819636,
906
+ "eval_loss": 0.4560508728027344,
907
+ "eval_runtime": 112.6939,
908
+ "eval_samples_per_second": 88.736,
909
+ "eval_steps_per_second": 5.546,
910
+ "step": 30000
911
+ },
912
+ {
913
+ "epoch": 0.06747339778333296,
914
+ "grad_norm": 3.36059308052063,
915
+ "learning_rate": 1.8904768830642685e-05,
916
+ "loss": 0.5198472900390625,
917
+ "step": 30500
918
+ },
919
+ {
920
+ "epoch": 0.06747339778333296,
921
+ "eval_loss": 0.4543982446193695,
922
+ "eval_runtime": 112.2284,
923
+ "eval_samples_per_second": 89.104,
924
+ "eval_steps_per_second": 5.569,
925
+ "step": 30500
926
+ },
927
+ {
928
+ "epoch": 0.06857951905846957,
929
+ "grad_norm": 4.251373291015625,
930
+ "learning_rate": 1.8868665756330093e-05,
931
+ "loss": 0.5192612915039062,
932
+ "step": 31000
933
+ },
934
+ {
935
+ "epoch": 0.06857951905846957,
936
+ "eval_loss": 0.44903045892715454,
937
+ "eval_runtime": 111.4899,
938
+ "eval_samples_per_second": 89.694,
939
+ "eval_steps_per_second": 5.606,
940
+ "step": 31000
941
+ },
942
+ {
943
+ "epoch": 0.06968564033360618,
944
+ "grad_norm": 4.051659107208252,
945
+ "learning_rate": 1.88320128753556e-05,
946
+ "loss": 0.5216185913085938,
947
+ "step": 31500
948
+ },
949
+ {
950
+ "epoch": 0.06968564033360618,
951
+ "eval_loss": 0.4525564908981323,
952
+ "eval_runtime": 112.0607,
953
+ "eval_samples_per_second": 89.237,
954
+ "eval_steps_per_second": 5.577,
955
+ "step": 31500
956
+ },
957
+ {
958
+ "epoch": 0.07079176160874279,
959
+ "grad_norm": 4.67618989944458,
960
+ "learning_rate": 1.8794812459988646e-05,
961
+ "loss": 0.507496826171875,
962
+ "step": 32000
963
+ },
964
+ {
965
+ "epoch": 0.07079176160874279,
966
+ "eval_loss": 0.45252183079719543,
967
+ "eval_runtime": 111.3402,
968
+ "eval_samples_per_second": 89.815,
969
+ "eval_steps_per_second": 5.613,
970
+ "step": 32000
971
+ },
972
+ {
973
+ "epoch": 0.07189788288387938,
974
+ "grad_norm": 2.5967023372650146,
975
+ "learning_rate": 1.8757066816442668e-05,
976
+ "loss": 0.5137508544921875,
977
+ "step": 32500
978
+ },
979
+ {
980
+ "epoch": 0.07189788288387938,
981
+ "eval_loss": 0.4464685618877411,
982
+ "eval_runtime": 112.1495,
983
+ "eval_samples_per_second": 89.167,
984
+ "eval_steps_per_second": 5.573,
985
+ "step": 32500
986
+ },
987
+ {
988
+ "epoch": 0.07300400415901599,
989
+ "grad_norm": 3.3378617763519287,
990
+ "learning_rate": 1.8718778284732152e-05,
991
+ "loss": 0.5107922058105469,
992
+ "step": 33000
993
+ },
994
+ {
995
+ "epoch": 0.07300400415901599,
996
+ "eval_loss": 0.445722371339798,
997
+ "eval_runtime": 111.8941,
998
+ "eval_samples_per_second": 89.37,
999
+ "eval_steps_per_second": 5.586,
1000
+ "step": 33000
1001
+ },
1002
+ {
1003
+ "epoch": 0.0741101254341526,
1004
+ "grad_norm": 3.411388397216797,
1005
+ "learning_rate": 1.8679949238527535e-05,
1006
+ "loss": 0.5060233154296875,
1007
+ "step": 33500
1008
+ },
1009
+ {
1010
+ "epoch": 0.0741101254341526,
1011
+ "eval_loss": 0.448230504989624,
1012
+ "eval_runtime": 111.1727,
1013
+ "eval_samples_per_second": 89.95,
1014
+ "eval_steps_per_second": 5.622,
1015
+ "step": 33500
1016
+ },
1017
+ {
1018
+ "epoch": 0.07521624670928921,
1019
+ "grad_norm": 3.030487060546875,
1020
+ "learning_rate": 1.8640582085008087e-05,
1021
+ "loss": 0.5060429992675781,
1022
+ "step": 34000
1023
+ },
1024
+ {
1025
+ "epoch": 0.07521624670928921,
1026
+ "eval_loss": 0.4455428123474121,
1027
+ "eval_runtime": 112.3533,
1028
+ "eval_samples_per_second": 89.005,
1029
+ "eval_steps_per_second": 5.563,
1030
+ "step": 34000
1031
+ },
1032
+ {
1033
+ "epoch": 0.0763223679844258,
1034
+ "grad_norm": 3.8484420776367188,
1035
+ "learning_rate": 1.8600679264712652e-05,
1036
+ "loss": 0.5075642395019532,
1037
+ "step": 34500
1038
+ },
1039
+ {
1040
+ "epoch": 0.0763223679844258,
1041
+ "eval_loss": 0.4382660984992981,
1042
+ "eval_runtime": 112.4803,
1043
+ "eval_samples_per_second": 88.904,
1044
+ "eval_steps_per_second": 5.557,
1045
+ "step": 34500
1046
+ },
1047
+ {
1048
+ "epoch": 0.07742848925956242,
1049
+ "grad_norm": 3.2480130195617676,
1050
+ "learning_rate": 1.8560243251388347e-05,
1051
+ "loss": 0.501132568359375,
1052
+ "step": 35000
1053
+ },
1054
+ {
1055
+ "epoch": 0.07742848925956242,
1056
+ "eval_loss": 0.4425552189350128,
1057
+ "eval_runtime": 111.227,
1058
+ "eval_samples_per_second": 89.906,
1059
+ "eval_steps_per_second": 5.619,
1060
+ "step": 35000
1061
+ },
1062
+ {
1063
+ "epoch": 0.07853461053469903,
1064
+ "grad_norm": 3.756162166595459,
1065
+ "learning_rate": 1.851927655183723e-05,
1066
+ "loss": 0.5018593139648437,
1067
+ "step": 35500
1068
+ },
1069
+ {
1070
+ "epoch": 0.07853461053469903,
1071
+ "eval_loss": 0.4464947283267975,
1072
+ "eval_runtime": 111.8369,
1073
+ "eval_samples_per_second": 89.416,
1074
+ "eval_steps_per_second": 5.588,
1075
+ "step": 35500
1076
+ },
1077
+ {
1078
+ "epoch": 0.07964073180983564,
1079
+ "grad_norm": 3.9083096981048584,
1080
+ "learning_rate": 1.8477781705760868e-05,
1081
+ "loss": 0.5015058898925782,
1082
+ "step": 36000
1083
+ },
1084
+ {
1085
+ "epoch": 0.07964073180983564,
1086
+ "eval_loss": 0.43595874309539795,
1087
+ "eval_runtime": 111.7205,
1088
+ "eval_samples_per_second": 89.509,
1089
+ "eval_steps_per_second": 5.594,
1090
+ "step": 36000
1091
+ },
1092
+ {
1093
+ "epoch": 0.08074685308497223,
1094
+ "grad_norm": 3.7168922424316406,
1095
+ "learning_rate": 1.84357612856029e-05,
1096
+ "loss": 0.49204946899414065,
1097
+ "step": 36500
1098
+ },
1099
+ {
1100
+ "epoch": 0.08074685308497223,
1101
+ "eval_loss": 0.435894250869751,
1102
+ "eval_runtime": 111.6128,
1103
+ "eval_samples_per_second": 89.595,
1104
+ "eval_steps_per_second": 5.6,
1105
+ "step": 36500
1106
+ },
1107
+ {
1108
+ "epoch": 0.08185297436010884,
1109
+ "grad_norm": 3.5467872619628906,
1110
+ "learning_rate": 1.839321789638955e-05,
1111
+ "loss": 0.49367572021484374,
1112
+ "step": 37000
1113
+ },
1114
+ {
1115
+ "epoch": 0.08185297436010884,
1116
+ "eval_loss": 0.43340766429901123,
1117
+ "eval_runtime": 111.3967,
1118
+ "eval_samples_per_second": 89.769,
1119
+ "eval_steps_per_second": 5.611,
1120
+ "step": 37000
1121
+ },
1122
+ {
1123
+ "epoch": 0.08295909563524545,
1124
+ "grad_norm": 3.1759660243988037,
1125
+ "learning_rate": 1.8350154175568158e-05,
1126
+ "loss": 0.49164642333984376,
1127
+ "step": 37500
1128
+ },
1129
+ {
1130
+ "epoch": 0.08295909563524545,
1131
+ "eval_loss": 0.4309427738189697,
1132
+ "eval_runtime": 111.7776,
1133
+ "eval_samples_per_second": 89.463,
1134
+ "eval_steps_per_second": 5.591,
1135
+ "step": 37500
1136
+ },
1137
+ {
1138
+ "epoch": 0.08406521691038206,
1139
+ "grad_norm": 2.551203727722168,
1140
+ "learning_rate": 1.8306572792843637e-05,
1141
+ "loss": 0.5008921813964844,
1142
+ "step": 38000
1143
+ },
1144
+ {
1145
+ "epoch": 0.08406521691038206,
1146
+ "eval_loss": 0.43083590269088745,
1147
+ "eval_runtime": 111.5917,
1148
+ "eval_samples_per_second": 89.612,
1149
+ "eval_steps_per_second": 5.601,
1150
+ "step": 38000
1151
+ },
1152
+ {
1153
+ "epoch": 0.08517133818551866,
1154
+ "grad_norm": 3.143233299255371,
1155
+ "learning_rate": 1.8262476450012997e-05,
1156
+ "loss": 0.49582595825195314,
1157
+ "step": 38500
1158
+ },
1159
+ {
1160
+ "epoch": 0.08517133818551866,
1161
+ "eval_loss": 0.4258905351161957,
1162
+ "eval_runtime": 111.0909,
1163
+ "eval_samples_per_second": 90.016,
1164
+ "eval_steps_per_second": 5.626,
1165
+ "step": 38500
1166
+ },
1167
+ {
1168
+ "epoch": 0.08627745946065526,
1169
+ "grad_norm": 3.648927927017212,
1170
+ "learning_rate": 1.8217867880797815e-05,
1171
+ "loss": 0.49535494995117185,
1172
+ "step": 39000
1173
+ },
1174
+ {
1175
+ "epoch": 0.08627745946065526,
1176
+ "eval_loss": 0.4332347512245178,
1177
+ "eval_runtime": 110.8231,
1178
+ "eval_samples_per_second": 90.234,
1179
+ "eval_steps_per_second": 5.64,
1180
+ "step": 39000
1181
+ },
1182
+ {
1183
+ "epoch": 0.08738358073579187,
1184
+ "grad_norm": 3.230006217956543,
1185
+ "learning_rate": 1.8172749850674803e-05,
1186
+ "loss": 0.4937856140136719,
1187
+ "step": 39500
1188
+ },
1189
+ {
1190
+ "epoch": 0.08738358073579187,
1191
+ "eval_loss": 0.4286055266857147,
1192
+ "eval_runtime": 112.0444,
1193
+ "eval_samples_per_second": 89.25,
1194
+ "eval_steps_per_second": 5.578,
1195
+ "step": 39500
1196
+ },
1197
+ {
1198
+ "epoch": 0.08848970201092848,
1199
+ "grad_norm": 3.8436365127563477,
1200
+ "learning_rate": 1.8127125156704334e-05,
1201
+ "loss": 0.4838755187988281,
1202
+ "step": 40000
1203
+ },
1204
+ {
1205
+ "epoch": 0.08848970201092848,
1206
+ "eval_loss": 0.4219776391983032,
1207
+ "eval_runtime": 111.1774,
1208
+ "eval_samples_per_second": 89.946,
1209
+ "eval_steps_per_second": 5.622,
1210
+ "step": 40000
1211
+ },
1212
+ {
1213
+ "epoch": 0.08959582328606508,
1214
+ "grad_norm": 4.849334716796875,
1215
+ "learning_rate": 1.8080996627357037e-05,
1216
+ "loss": 0.4815330505371094,
1217
+ "step": 40500
1218
+ },
1219
+ {
1220
+ "epoch": 0.08959582328606508,
1221
+ "eval_loss": 0.42751649022102356,
1222
+ "eval_runtime": 111.231,
1223
+ "eval_samples_per_second": 89.903,
1224
+ "eval_steps_per_second": 5.619,
1225
+ "step": 40500
1226
+ },
1227
+ {
1228
+ "epoch": 0.09070194456120169,
1229
+ "grad_norm": 2.9716176986694336,
1230
+ "learning_rate": 1.8034367122338477e-05,
1231
+ "loss": 0.4810438232421875,
1232
+ "step": 41000
1233
+ },
1234
+ {
1235
+ "epoch": 0.09070194456120169,
1236
+ "eval_loss": 0.42341557145118713,
1237
+ "eval_runtime": 110.5253,
1238
+ "eval_samples_per_second": 90.477,
1239
+ "eval_steps_per_second": 5.655,
1240
+ "step": 41000
1241
+ },
1242
+ {
1243
+ "epoch": 0.0918080658363383,
1244
+ "grad_norm": 4.334221363067627,
1245
+ "learning_rate": 1.798723953241184e-05,
1246
+ "loss": 0.4755215148925781,
1247
+ "step": 41500
1248
+ },
1249
+ {
1250
+ "epoch": 0.0918080658363383,
1251
+ "eval_loss": 0.42155927419662476,
1252
+ "eval_runtime": 112.2482,
1253
+ "eval_samples_per_second": 89.088,
1254
+ "eval_steps_per_second": 5.568,
1255
+ "step": 41500
1256
+ },
1257
+ {
1258
+ "epoch": 0.09291418711147491,
1259
+ "grad_norm": 6.2074432373046875,
1260
+ "learning_rate": 1.7939616779218728e-05,
1261
+ "loss": 0.4806861877441406,
1262
+ "step": 42000
1263
+ },
1264
+ {
1265
+ "epoch": 0.09291418711147491,
1266
+ "eval_loss": 0.4218466281890869,
1267
+ "eval_runtime": 111.7787,
1268
+ "eval_samples_per_second": 89.462,
1269
+ "eval_steps_per_second": 5.591,
1270
+ "step": 42000
1271
+ },
1272
+ {
1273
+ "epoch": 0.0940203083866115,
1274
+ "grad_norm": 3.6507174968719482,
1275
+ "learning_rate": 1.7891501815098063e-05,
1276
+ "loss": 0.4757821044921875,
1277
+ "step": 42500
1278
+ },
1279
+ {
1280
+ "epoch": 0.0940203083866115,
1281
+ "eval_loss": 0.41902461647987366,
1282
+ "eval_runtime": 111.5077,
1283
+ "eval_samples_per_second": 89.68,
1284
+ "eval_steps_per_second": 5.605,
1285
+ "step": 42500
1286
+ },
1287
+ {
1288
+ "epoch": 0.09512642966174811,
1289
+ "grad_norm": 3.918403148651123,
1290
+ "learning_rate": 1.784289762290301e-05,
1291
+ "loss": 0.4804989013671875,
1292
+ "step": 43000
1293
+ },
1294
+ {
1295
+ "epoch": 0.09512642966174811,
1296
+ "eval_loss": 0.42434442043304443,
1297
+ "eval_runtime": 111.2033,
1298
+ "eval_samples_per_second": 89.925,
1299
+ "eval_steps_per_second": 5.62,
1300
+ "step": 43000
1301
+ },
1302
+ {
1303
+ "epoch": 0.09623255093688472,
1304
+ "grad_norm": 3.1801273822784424,
1305
+ "learning_rate": 1.7793807215816095e-05,
1306
+ "loss": 0.4728958740234375,
1307
+ "step": 43500
1308
+ },
1309
+ {
1310
+ "epoch": 0.09623255093688472,
1311
+ "eval_loss": 0.4186353385448456,
1312
+ "eval_runtime": 111.5175,
1313
+ "eval_samples_per_second": 89.672,
1314
+ "eval_steps_per_second": 5.604,
1315
+ "step": 43500
1316
+ },
1317
+ {
1318
+ "epoch": 0.09733867221202133,
1319
+ "grad_norm": 3.6735751628875732,
1320
+ "learning_rate": 1.7744233637162387e-05,
1321
+ "loss": 0.4641239929199219,
1322
+ "step": 44000
1323
+ },
1324
+ {
1325
+ "epoch": 0.09733867221202133,
1326
+ "eval_loss": 0.41301777958869934,
1327
+ "eval_runtime": 110.8625,
1328
+ "eval_samples_per_second": 90.202,
1329
+ "eval_steps_per_second": 5.638,
1330
+ "step": 44000
1331
+ },
1332
+ {
1333
+ "epoch": 0.09844479348715793,
1334
+ "grad_norm": 2.789695978164673,
1335
+ "learning_rate": 1.7694179960220842e-05,
1336
+ "loss": 0.4733058166503906,
1337
+ "step": 44500
1338
+ },
1339
+ {
1340
+ "epoch": 0.09844479348715793,
1341
+ "eval_loss": 0.42087632417678833,
1342
+ "eval_runtime": 111.0363,
1343
+ "eval_samples_per_second": 90.061,
1344
+ "eval_steps_per_second": 5.629,
1345
+ "step": 44500
1346
+ },
1347
+ {
1348
+ "epoch": 0.09955091476229454,
1349
+ "grad_norm": 3.6969802379608154,
1350
+ "learning_rate": 1.7643649288033766e-05,
1351
+ "loss": 0.4693783874511719,
1352
+ "step": 45000
1353
+ },
1354
+ {
1355
+ "epoch": 0.09955091476229454,
1356
+ "eval_loss": 0.4166164994239807,
1357
+ "eval_runtime": 111.4744,
1358
+ "eval_samples_per_second": 89.707,
1359
+ "eval_steps_per_second": 5.607,
1360
+ "step": 45000
1361
+ },
1362
+ {
1363
+ "epoch": 0.10065703603743115,
1364
+ "grad_norm": 3.573570966720581,
1365
+ "learning_rate": 1.7592644753214445e-05,
1366
+ "loss": 0.4692704162597656,
1367
+ "step": 45500
1368
+ },
1369
+ {
1370
+ "epoch": 0.10065703603743115,
1371
+ "eval_loss": 0.41210126876831055,
1372
+ "eval_runtime": 111.5033,
1373
+ "eval_samples_per_second": 89.683,
1374
+ "eval_steps_per_second": 5.605,
1375
+ "step": 45500
1376
+ },
1377
+ {
1378
+ "epoch": 0.10176315731256776,
1379
+ "grad_norm": 3.356349229812622,
1380
+ "learning_rate": 1.7541169517752944e-05,
1381
+ "loss": 0.46585760498046874,
1382
+ "step": 46000
1383
+ },
1384
+ {
1385
+ "epoch": 0.10176315731256776,
1386
+ "eval_loss": 0.41443243622779846,
1387
+ "eval_runtime": 111.179,
1388
+ "eval_samples_per_second": 89.945,
1389
+ "eval_steps_per_second": 5.622,
1390
+ "step": 46000
1391
+ },
1392
+ {
1393
+ "epoch": 0.10286927858770435,
1394
+ "grad_norm": 2.9996583461761475,
1395
+ "learning_rate": 1.748922677282009e-05,
1396
+ "loss": 0.4640685119628906,
1397
+ "step": 46500
1398
+ },
1399
+ {
1400
+ "epoch": 0.10286927858770435,
1401
+ "eval_loss": 0.41033294796943665,
1402
+ "eval_runtime": 110.8113,
1403
+ "eval_samples_per_second": 90.243,
1404
+ "eval_steps_per_second": 5.64,
1405
+ "step": 46500
1406
+ },
1407
+ {
1408
+ "epoch": 0.10397539986284096,
1409
+ "grad_norm": 4.090509414672852,
1410
+ "learning_rate": 1.7436819738569617e-05,
1411
+ "loss": 0.46669842529296873,
1412
+ "step": 47000
1413
+ },
1414
+ {
1415
+ "epoch": 0.10397539986284096,
1416
+ "eval_loss": 0.4172143042087555,
1417
+ "eval_runtime": 111.5976,
1418
+ "eval_samples_per_second": 89.608,
1419
+ "eval_steps_per_second": 5.6,
1420
+ "step": 47000
1421
+ },
1422
+ {
1423
+ "epoch": 0.10508152113797757,
1424
+ "grad_norm": 3.4085447788238525,
1425
+ "learning_rate": 1.7383951663938554e-05,
1426
+ "loss": 0.46754437255859377,
1427
+ "step": 47500
1428
+ },
1429
+ {
1430
+ "epoch": 0.10508152113797757,
1431
+ "eval_loss": 0.4096528887748718,
1432
+ "eval_runtime": 110.9486,
1433
+ "eval_samples_per_second": 90.132,
1434
+ "eval_steps_per_second": 5.633,
1435
+ "step": 47500
1436
+ },
1437
+ {
1438
+ "epoch": 0.10618764241311418,
1439
+ "grad_norm": 3.7726781368255615,
1440
+ "learning_rate": 1.7330625826445803e-05,
1441
+ "loss": 0.465860107421875,
1442
+ "step": 48000
1443
+ },
1444
+ {
1445
+ "epoch": 0.10618764241311418,
1446
+ "eval_loss": 0.4105297923088074,
1447
+ "eval_runtime": 111.2199,
1448
+ "eval_samples_per_second": 89.912,
1449
+ "eval_steps_per_second": 5.619,
1450
+ "step": 48000
1451
+ },
1452
+ {
1453
+ "epoch": 0.10729376368825078,
1454
+ "grad_norm": 3.026475191116333,
1455
+ "learning_rate": 1.727684553198895e-05,
1456
+ "loss": 0.47103488159179685,
1457
+ "step": 48500
1458
+ },
1459
+ {
1460
+ "epoch": 0.10729376368825078,
1461
+ "eval_loss": 0.4050140380859375,
1462
+ "eval_runtime": 111.9615,
1463
+ "eval_samples_per_second": 89.316,
1464
+ "eval_steps_per_second": 5.582,
1465
+ "step": 48500
1466
+ },
1467
+ {
1468
+ "epoch": 0.10839988496338739,
1469
+ "grad_norm": 4.641044616699219,
1470
+ "learning_rate": 1.722261411463931e-05,
1471
+ "loss": 0.45761444091796877,
1472
+ "step": 49000
1473
+ },
1474
+ {
1475
+ "epoch": 0.10839988496338739,
1476
+ "eval_loss": 0.40581125020980835,
1477
+ "eval_runtime": 111.9255,
1478
+ "eval_samples_per_second": 89.345,
1479
+ "eval_steps_per_second": 5.584,
1480
+ "step": 49000
1481
+ },
1482
+ {
1483
+ "epoch": 0.109506006238524,
1484
+ "grad_norm": 2.750777244567871,
1485
+ "learning_rate": 1.716793493643526e-05,
1486
+ "loss": 0.45857110595703127,
1487
+ "step": 49500
1488
+ },
1489
+ {
1490
+ "epoch": 0.109506006238524,
1491
+ "eval_loss": 0.4027765989303589,
1492
+ "eval_runtime": 110.8459,
1493
+ "eval_samples_per_second": 90.215,
1494
+ "eval_steps_per_second": 5.638,
1495
+ "step": 49500
1496
+ },
1497
+ {
1498
+ "epoch": 0.11061212751366059,
1499
+ "grad_norm": 3.3473005294799805,
1500
+ "learning_rate": 1.711281138717378e-05,
1501
+ "loss": 0.4617832946777344,
1502
+ "step": 50000
1503
+ },
1504
+ {
1505
+ "epoch": 0.11061212751366059,
1506
+ "eval_loss": 0.40101996064186096,
1507
+ "eval_runtime": 111.2161,
1508
+ "eval_samples_per_second": 89.915,
1509
+ "eval_steps_per_second": 5.62,
1510
+ "step": 50000
1511
+ },
1512
+ {
1513
+ "epoch": 0.1117182487887972,
1514
+ "grad_norm": 3.5542516708374023,
1515
+ "learning_rate": 1.705724688420033e-05,
1516
+ "loss": 0.46245761108398437,
1517
+ "step": 50500
1518
+ },
1519
+ {
1520
+ "epoch": 0.1117182487887972,
1521
+ "eval_loss": 0.40440794825553894,
1522
+ "eval_runtime": 111.9693,
1523
+ "eval_samples_per_second": 89.31,
1524
+ "eval_steps_per_second": 5.582,
1525
+ "step": 50500
1526
+ }
1527
+ ],
1528
+ "logging_steps": 500,
1529
+ "max_steps": 200000,
1530
+ "num_input_tokens_seen": 0,
1531
+ "num_train_epochs": 1,
1532
+ "save_steps": 500,
1533
+ "stateful_callbacks": {
1534
+ "EarlyStoppingCallback": {
1535
+ "args": {
1536
+ "early_stopping_patience": 8,
1537
+ "early_stopping_threshold": 0.0
1538
+ },
1539
+ "attributes": {
1540
+ "early_stopping_patience_counter": 1
1541
+ }
1542
+ },
1543
+ "TrainerControl": {
1544
+ "args": {
1545
+ "should_epoch_stop": false,
1546
+ "should_evaluate": false,
1547
+ "should_log": false,
1548
+ "should_save": true,
1549
+ "should_training_stop": false
1550
+ },
1551
+ "attributes": {}
1552
+ }
1553
+ },
1554
+ "total_flos": 1.06610283282432e+17,
1555
+ "train_batch_size": 16,
1556
+ "trial_name": null,
1557
+ "trial_params": null
1558
+ }
microsoft__mdeberta-v3-base/tmp_checkpoints/checkpoint-50500/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2835879e43c1b45efad4c20bb67332efa26e28b338fb07bcd82b145150d4a34a
3
+ size 4920