update config.json

#7
by erichen - opened
Files changed (1) hide show
  1. config.json +0 -6
config.json CHANGED
@@ -66,14 +66,12 @@
66
  "kda_safe_gate": true,
67
  "kv_lora_rank": 512,
68
  "layer_group_size": 6,
69
- "linear_silu": true,
70
  "max_position_embeddings": 262144,
71
  "max_window_layers": 20,
72
  "moe_intermediate_size": 768,
73
  "moe_router_enable_expert_bias": true,
74
  "moe_shared_expert_intermediate_size": 768,
75
  "mtp_loss_scaling_factor": 0,
76
- "mtp_use_kda": false,
77
  "n_group": 8,
78
  "no_kda_lora": true,
79
  "norm_topk_prob": true,
@@ -82,7 +80,6 @@
82
  "num_experts_per_tok": 8,
83
  "num_hidden_layers": 42,
84
  "num_key_value_heads": 32,
85
- "num_kv_heads_for_linear_attn": 0,
86
  "num_nextn_predict_layers": 1,
87
  "num_shared_experts": 1,
88
  "output_dropout": 0.0,
@@ -156,13 +153,10 @@
156
  "up_proj_norm": false,
157
  "use_bias": false,
158
  "use_cache": true,
159
- "use_kda_lora": false,
160
  "use_mla_nope": false,
161
- "use_nGPT": false,
162
  "use_qk_norm": true,
163
  "use_qkv_bias": false,
164
  "v_head_dim": 128,
165
- "value_norm": false,
166
  "vocab_size": 157184,
167
  "model_type": "bailing_hybrid",
168
  "torch_dtype": "bfloat16",
 
66
  "kda_safe_gate": true,
67
  "kv_lora_rank": 512,
68
  "layer_group_size": 6,
 
69
  "max_position_embeddings": 262144,
70
  "max_window_layers": 20,
71
  "moe_intermediate_size": 768,
72
  "moe_router_enable_expert_bias": true,
73
  "moe_shared_expert_intermediate_size": 768,
74
  "mtp_loss_scaling_factor": 0,
 
75
  "n_group": 8,
76
  "no_kda_lora": true,
77
  "norm_topk_prob": true,
 
80
  "num_experts_per_tok": 8,
81
  "num_hidden_layers": 42,
82
  "num_key_value_heads": 32,
 
83
  "num_nextn_predict_layers": 1,
84
  "num_shared_experts": 1,
85
  "output_dropout": 0.0,
 
153
  "up_proj_norm": false,
154
  "use_bias": false,
155
  "use_cache": true,
 
156
  "use_mla_nope": false,
 
157
  "use_qk_norm": true,
158
  "use_qkv_bias": false,
159
  "v_head_dim": 128,
 
160
  "vocab_size": 157184,
161
  "model_type": "bailing_hybrid",
162
  "torch_dtype": "bfloat16",