m1ngcheng commited on
Commit
33ee043
·
verified ·
1 Parent(s): 77dec5c

Add files using upload-large-folder tool

Browse files
config.json ADDED
@@ -0,0 +1,58 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "LLaDA2MoeModelLM"
4
+ ],
5
+ "attention_dropout": 0.0,
6
+ "auto_map": {
7
+ "AutoConfig": "configuration_llada2_moe.LLaDA2MoeConfig",
8
+ "AutoModel": "modeling_llada2_moe.LLaDA2MoeModel",
9
+ "AutoModelForCausalLM": "modeling_llada2_moe.LLaDA2MoeModelLM"
10
+ },
11
+ "num_hidden_layers": 32,
12
+ "hidden_size": 4096,
13
+ "intermediate_size": 9216,
14
+ "first_k_dense_replace": 1,
15
+ "hidden_act": "silu",
16
+ "max_position_embeddings": 131072,
17
+ "model_type": "llada2_moe",
18
+ "moe_intermediate_size": 1024,
19
+ "norm_topk_prob": true,
20
+ "num_experts_per_tok": 8,
21
+ "expert_capacity": 48,
22
+ "block_size": 32,
23
+ "norm_head": false,
24
+ "num_attention_heads": 32,
25
+ "num_experts": 256,
26
+ "num_key_value_heads": 4,
27
+ "rope_theta": 3000000,
28
+ "rope_scaling": null,
29
+ "tie_word_embeddings": false,
30
+ "torch_dtype": "bfloat16",
31
+ "transformers_version": "4.52.3",
32
+ "use_bias": false,
33
+ "use_rmsnorm": true,
34
+ "rms_norm_eps": 1e-06,
35
+ "head_dim": 128,
36
+ "num_shared_experts": 1,
37
+ "use_cache": false,
38
+ "use_qk_norm": true,
39
+ "use_qkv_bias": false,
40
+ "embedding_dropout": 0.0,
41
+ "norm_softmax": false,
42
+ "output_dropout": 0.0,
43
+ "vocab_size": 157184,
44
+ "rotary_dim": 64,
45
+ "using_split_qkv_in_self_attention": false,
46
+ "router_dtype": "fp32",
47
+ "moe_router_enable_expert_bias": true,
48
+ "routed_scaling_factor": 2.5,
49
+ "n_group": 8,
50
+ "topk_group": 4,
51
+ "score_function": "sigmoid",
52
+ "initializer_range": 0.02,
53
+ "max_window_layers": 28,
54
+ "output_router_logits": false,
55
+ "pad_token_id": 156892,
56
+ "partial_rotary_factor": 0.5,
57
+ "use_sliding_window": false
58
+ }
configuration_llada2_moe.py ADDED
@@ -0,0 +1,94 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ """LLaDA2 MoE model configuration"""
2
+
3
+ from transformers.configuration_utils import PretrainedConfig
4
+
5
+
6
+ class LLaDA2MoeConfig(PretrainedConfig):
7
+ model_type = "llada2_moe"
8
+
9
+ def __init__(
10
+ self,
11
+ vocab_size=30592,
12
+ hidden_size=1024,
13
+ intermediate_size=None,
14
+ num_hidden_layers=24,
15
+ num_attention_heads=16,
16
+ num_key_value_heads=0,
17
+ hidden_act="silu",
18
+ use_qkv_bias=False, # llada2 only
19
+ use_qk_norm=False,
20
+ use_bias=True, # llada2 only
21
+ rms_norm_eps=1e-05,
22
+ norm_head=False, # llada2 only
23
+ tie_word_embeddings=False, # PretrainedConfig key, here change default value.
24
+ embedding_dropout=0.1,
25
+ attention_dropout=0.1,
26
+ output_dropout=0.1,
27
+ initializer_range=0.02,
28
+ max_position_embeddings=16384,
29
+ rope_theta=10000.0,
30
+ use_cache=True,
31
+ use_sliding_window=False,
32
+ sliding_window=4096,
33
+ max_window_layers=28,
34
+ rope_scaling=None,
35
+ pad_token_id=126081,
36
+ num_experts=16,
37
+ num_shared_experts=0,
38
+ num_experts_per_tok=2,
39
+ n_group=8,
40
+ topk_group=4,
41
+ routed_scaling_factor=2.5,
42
+ moe_intermediate_size=None,
43
+ first_k_dense_replace=0,
44
+ head_dim=None,
45
+ output_router_logits=False,
46
+ partial_rotary_factor=0.5,
47
+ expert_capacity=48,
48
+ block_size=32,
49
+ **kwargs,
50
+ ):
51
+ self.num_hidden_layers = num_hidden_layers
52
+ self.vocab_size = vocab_size
53
+ self.hidden_size = hidden_size
54
+ self.intermediate_size = intermediate_size
55
+ self.num_attention_heads = num_attention_heads
56
+ self.num_key_value_heads = num_key_value_heads
57
+ self.hidden_act = hidden_act
58
+ self.use_qkv_bias = use_qkv_bias
59
+ self.use_qk_norm = use_qk_norm
60
+ self.use_bias = use_bias
61
+ self.norm_head = norm_head
62
+ self.rms_norm_eps = rms_norm_eps
63
+ self.embedding_dropout = embedding_dropout
64
+ self.attention_dropout = attention_dropout
65
+ self.output_dropout = output_dropout
66
+ self.initializer_range = initializer_range
67
+ self.max_position_embeddings = max_position_embeddings
68
+ self.rope_theta = rope_theta
69
+ self.use_cache = use_cache
70
+ self.use_sliding_window = use_sliding_window
71
+ self.sliding_window = sliding_window
72
+ self.max_window_layers = max_window_layers
73
+ self.head_dim = head_dim or self.hidden_size // self.num_attention_heads
74
+ self.rope_scaling = rope_scaling
75
+
76
+ # MoE configs
77
+ self.num_experts = num_experts
78
+ self.num_shared_experts = num_shared_experts
79
+ self.num_experts_per_tok = num_experts_per_tok
80
+ self.n_group = n_group
81
+ self.topk_group = topk_group
82
+ self.moe_intermediate_size = moe_intermediate_size
83
+ self.first_k_dense_replace = first_k_dense_replace
84
+ self.output_router_logits = output_router_logits
85
+ self.routed_scaling_factor = routed_scaling_factor
86
+ self.partial_rotary_factor = partial_rotary_factor
87
+
88
+ # Block routing configs
89
+ self.expert_capacity = expert_capacity
90
+ self.block_size = block_size
91
+
92
+ super().__init__(
93
+ pad_token_id=pad_token_id, tie_word_embeddings=tie_word_embeddings, **kwargs
94
+ )
generation_config.json ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "eos_token_id": [156892, 156900],
4
+ "pad_token_id": 156892,
5
+ "transformers_version": "4.52.3",
6
+ "use_cache": false
7
+ }
model-00000-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5d1990021fcc7bdbd07c1c0089073e2e6c412e1fd8cc4e40d349846087546127
3
+ size 12304705856
model-00001-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4abb1bc2dff14189ad2ed4b9800af3fb54757a0759ce68aed6204b11ee4a7deb
3
+ size 6241216968
model-00002-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a5a69255edc9ec0541f84448cb260da5b5067b45709554ea3e2a450b52eb267a
3
+ size 6241217160
model-00003-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d42ed754dbe4f71a8be830e36e60f896dcf3b843515cd02f44ba99c48b798b94
3
+ size 6241217160
model-00004-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fc808529f723a2094b0ed4feb6f73eaa57b41f6e3fc808e953890b9b1581b1ad
3
+ size 6241217160
model-00005-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d9b716b15ee2052eb27f367add5c058c2cdc379b4c0d694442320afa1f6d8014
3
+ size 6241217160
model-00006-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0ef0ab4f979996160dcedb3ea801ddaff6c76a8bd90743331eda8a38c7a37d66
3
+ size 6241217160
model-00007-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3ef1088e751d6f96b611596f82c2a75d40f2dc2ebcc89710cba0694aa44e11b4
3
+ size 6241217160
model-00008-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b3b29011b004955d811d126e6079b0a020fad605dfb838d994746fc2d3697386
3
+ size 6241217160
model-00009-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3ec94d969a5d31c9263d2f6ea883dee0e23d824bad7f5df6ce3c066541628051
3
+ size 6241217160
model-00010-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:edeb684cb0a29468d3292dd79bb349b8eb8b6b2b455da89b31272cfb02abe43d
3
+ size 6241217160
model-00011-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:057bbb40f925141c459c22b34fb29aa43293f9686b99c52eff40a5790d3b97a4
3
+ size 6241217160
model-00012-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5297203652203933efb0e5c1b4231592cd387d3e6a8ba005d6ad718ee1ba5cd5
3
+ size 6241217528
model-00013-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7b52c6ceb64ce9cc192e7153c1003f58feb84a6b4eff66dd8bcf14cbeaca08c3
3
+ size 6241217904
model-00014-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:790c089f45a061711ff6e2442359702b3011e4cf1055928e53175ff30db7da6c
3
+ size 6241217904
model-00015-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1688f8d99143a104fc743959d293c9c7e8ed88ca9246a32b6c66e568250e0e76
3
+ size 6241217904
model-00016-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2b673b90d7ce20df76bcd63ed68da1fc56a23c5b6ea66d80003a6b484a8583cb
3
+ size 6241217904
model-00017-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e9741de327958cd1542206f46df66c064ae8b55eaf6408c57ec32099097dd22e
3
+ size 6241217904
model-00018-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d2b1eedc53f6f5110c9f7cbda3e39682600572aa142b1c8792a50300572336ae
3
+ size 6241217904
model-00019-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7ce6cc65fadbe15d0d9695e1a5e371f2df4ae2c6bcb5fcb93ed731a3f4322fc2
3
+ size 6241217904
model-00020-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a173a41b95409b6d1aff76f2c923f51936f9679c07b4480e3220ed5e8aaf6688
3
+ size 6241217904
model-00021-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f369627b48e8ff61d77daca5dddc4fe8e66428156d25030d3c45c522fa212f48
3
+ size 6241217904
model-00022-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e1670d3b111e173e45f773e2aef2a982f7e8b074c5a74ce2b9d8a2d795d95a30
3
+ size 6241217904
model-00023-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6cb566ee0a2bb9161946dd7dd2785f3ff35f31cd59d26b8e52cd8888bc33126e
3
+ size 6241217904
model-00024-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:110d4e1c4071796e4e6d3562a6afa55a5e9653f79b22d507c9472baea9ab8a0e
3
+ size 6241217904
model-00025-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e50d758bed684abfd4dfe567d41d652908bb809ad4581925d750d4f82b384e12
3
+ size 6241217904
model-00026-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:12c25ff4880833827155b08ead89b59ee66cbf1942c7f30a511d6403df411be6
3
+ size 6241217904
model-00027-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:332260d4dd6c96a68cc679c712032caa5dda9ed6170f0b38b98917428ca1aa7d
3
+ size 6241217904
model-00028-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d67a39cce185e1c5ae88efe66247b94231de6ad4dd43d9696fd2a517a56a0ea2
3
+ size 6241217904
model-00029-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:300e136169bba055b66c2c47602494a4457e2c3f06764f2b7ba17cbaa9599e7f
3
+ size 6241217904
model-00030-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6dd9ec5fdd4b8bb609de7cc6c6dc3b5b18af98df086d6bc3c2da678f6d81fe78
3
+ size 6241217904
model-00031-of-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6c133427faaa6fc619549824fd96f60b2a1901eca7a0c47c85f8021a6168c3a7
3
+ size 6241217904
model.safetensors.index.json ADDED
The diff for this file is too large to render. See raw diff
 
special_tokens_map.json ADDED
@@ -0,0 +1,8 @@
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token": "<|startoftext|>",
3
+ "cls_token": "[CLS]",
4
+ "eos_token": "<|endoftext|>",
5
+ "gmask_token": "[gMASK]",
6
+ "pad_token": "<|endoftext|>",
7
+ "mask_token": "<|mask|>"
8
+ }
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,145 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "added_tokens_decoder": {
3
+ "156891": {
4
+ "content": "<|startoftext|>",
5
+ "lstrip": false,
6
+ "normalized": false,
7
+ "rstrip": false,
8
+ "single_word": false,
9
+ "special": true
10
+ },
11
+ "156892": {
12
+ "content": "<|endoftext|>",
13
+ "lstrip": false,
14
+ "normalized": false,
15
+ "rstrip": false,
16
+ "single_word": false,
17
+ "special": true
18
+ },
19
+ "156893": {
20
+ "content": "[CLS]",
21
+ "lstrip": false,
22
+ "normalized": false,
23
+ "rstrip": false,
24
+ "single_word": false,
25
+ "special": true
26
+ },
27
+ "156894": {
28
+ "content": "[gMASK]",
29
+ "lstrip": false,
30
+ "normalized": false,
31
+ "rstrip": false,
32
+ "single_word": false,
33
+ "special": true
34
+ },
35
+ "156895": {
36
+ "content": "<|mask|>",
37
+ "lstrip": false,
38
+ "normalized": false,
39
+ "rstrip": false,
40
+ "single_word": false,
41
+ "special": true
42
+ },
43
+ "156896": {
44
+ "content": "<tools>",
45
+ "lstrip": false,
46
+ "normalized": false,
47
+ "rstrip": false,
48
+ "single_word": false,
49
+ "special": false
50
+ },
51
+ "156897": {
52
+ "content": "</tools>",
53
+ "lstrip": false,
54
+ "normalized": false,
55
+ "rstrip": false,
56
+ "single_word": false,
57
+ "special": false
58
+ },
59
+ "156898": {
60
+ "content": "<think>",
61
+ "lstrip": false,
62
+ "normalized": false,
63
+ "rstrip": false,
64
+ "single_word": false,
65
+ "special": false
66
+ },
67
+ "156899": {
68
+ "content": "</think>",
69
+ "lstrip": false,
70
+ "normalized": false,
71
+ "rstrip": false,
72
+ "single_word": false,
73
+ "special": false
74
+ },
75
+ "156900": {
76
+ "content": "<|role_end|>",
77
+ "lstrip": false,
78
+ "normalized": false,
79
+ "rstrip": false,
80
+ "single_word": false,
81
+ "special": true
82
+ },
83
+ "156901": {
84
+ "content": "<|tool_calls_section_begin|>",
85
+ "lstrip": false,
86
+ "normalized": false,
87
+ "rstrip": false,
88
+ "single_word": false,
89
+ "special": false
90
+ },
91
+ "156902": {
92
+ "content": "<|tool_calls_section_end|>",
93
+ "lstrip": false,
94
+ "normalized": false,
95
+ "rstrip": false,
96
+ "single_word": false,
97
+ "special": false
98
+ },
99
+ "156903": {
100
+ "content": "<|tool_call_begin|>",
101
+ "lstrip": false,
102
+ "normalized": false,
103
+ "rstrip": false,
104
+ "single_word": false,
105
+ "special": false
106
+ },
107
+ "156904": {
108
+ "content": "<|tool_call_argument_begin|>",
109
+ "lstrip": false,
110
+ "normalized": false,
111
+ "rstrip": false,
112
+ "single_word": false,
113
+ "special": false
114
+ },
115
+ "156905": {
116
+ "content": "<|tool_call_end|>",
117
+ "lstrip": false,
118
+ "normalized": false,
119
+ "rstrip": false,
120
+ "single_word": false,
121
+ "special": false
122
+ }
123
+ },
124
+ "add_bos_token": false,
125
+ "add_eos_token": false,
126
+ "bos_token": "<|startoftext|>",
127
+ "clean_up_tokenization_spaces": false,
128
+ "cls_token": "[CLS]",
129
+ "eos_token": "<|endoftext|>",
130
+ "mask_token": "<|mask|>",
131
+ "fast_tokenizer": true,
132
+ "gmask_token": "[gMASK]",
133
+ "merges_file": null,
134
+ "model_max_length": 262144,
135
+ "pad_token": "<|endoftext|>",
136
+ "tokenizer_class": "CustomFastTokenizer",
137
+ "auto_map": {
138
+ "AutoTokenizer": [
139
+ "tokenization_llada2.CustomFastTokenizer",
140
+ null
141
+ ]
142
+ },
143
+ "trust_remote_code": true,
144
+ "vocab_file": null
145
+ }