update config.json
#7
by erichen - opened
- config.json +0 -6
config.json
CHANGED
|
@@ -66,14 +66,12 @@
|
|
| 66 |
"kda_safe_gate": true,
|
| 67 |
"kv_lora_rank": 512,
|
| 68 |
"layer_group_size": 6,
|
| 69 |
-
"linear_silu": true,
|
| 70 |
"max_position_embeddings": 262144,
|
| 71 |
"max_window_layers": 20,
|
| 72 |
"moe_intermediate_size": 768,
|
| 73 |
"moe_router_enable_expert_bias": true,
|
| 74 |
"moe_shared_expert_intermediate_size": 768,
|
| 75 |
"mtp_loss_scaling_factor": 0,
|
| 76 |
-
"mtp_use_kda": false,
|
| 77 |
"n_group": 8,
|
| 78 |
"no_kda_lora": true,
|
| 79 |
"norm_topk_prob": true,
|
|
@@ -82,7 +80,6 @@
|
|
| 82 |
"num_experts_per_tok": 8,
|
| 83 |
"num_hidden_layers": 42,
|
| 84 |
"num_key_value_heads": 32,
|
| 85 |
-
"num_kv_heads_for_linear_attn": 0,
|
| 86 |
"num_nextn_predict_layers": 1,
|
| 87 |
"num_shared_experts": 1,
|
| 88 |
"output_dropout": 0.0,
|
|
@@ -156,13 +153,10 @@
|
|
| 156 |
"up_proj_norm": false,
|
| 157 |
"use_bias": false,
|
| 158 |
"use_cache": true,
|
| 159 |
-
"use_kda_lora": false,
|
| 160 |
"use_mla_nope": false,
|
| 161 |
-
"use_nGPT": false,
|
| 162 |
"use_qk_norm": true,
|
| 163 |
"use_qkv_bias": false,
|
| 164 |
"v_head_dim": 128,
|
| 165 |
-
"value_norm": false,
|
| 166 |
"vocab_size": 157184,
|
| 167 |
"model_type": "bailing_hybrid",
|
| 168 |
"torch_dtype": "bfloat16",
|
|
|
|
| 66 |
"kda_safe_gate": true,
|
| 67 |
"kv_lora_rank": 512,
|
| 68 |
"layer_group_size": 6,
|
|
|
|
| 69 |
"max_position_embeddings": 262144,
|
| 70 |
"max_window_layers": 20,
|
| 71 |
"moe_intermediate_size": 768,
|
| 72 |
"moe_router_enable_expert_bias": true,
|
| 73 |
"moe_shared_expert_intermediate_size": 768,
|
| 74 |
"mtp_loss_scaling_factor": 0,
|
|
|
|
| 75 |
"n_group": 8,
|
| 76 |
"no_kda_lora": true,
|
| 77 |
"norm_topk_prob": true,
|
|
|
|
| 80 |
"num_experts_per_tok": 8,
|
| 81 |
"num_hidden_layers": 42,
|
| 82 |
"num_key_value_heads": 32,
|
|
|
|
| 83 |
"num_nextn_predict_layers": 1,
|
| 84 |
"num_shared_experts": 1,
|
| 85 |
"output_dropout": 0.0,
|
|
|
|
| 153 |
"up_proj_norm": false,
|
| 154 |
"use_bias": false,
|
| 155 |
"use_cache": true,
|
|
|
|
| 156 |
"use_mla_nope": false,
|
|
|
|
| 157 |
"use_qk_norm": true,
|
| 158 |
"use_qkv_bias": false,
|
| 159 |
"v_head_dim": 128,
|
|
|
|
| 160 |
"vocab_size": 157184,
|
| 161 |
"model_type": "bailing_hybrid",
|
| 162 |
"torch_dtype": "bfloat16",
|