Instructions to use MrezaPRZ/CodeLlama-3x7B-dialect-experts-base with libraries, inference providers, notebooks, and local apps. Follow these links to get started.

Libraries

How to use MrezaPRZ/CodeLlama-3x7B-dialect-experts-base with Transformers:

# Use a pipeline as a high-level helper
from transformers import pipeline

pipe = pipeline("text-generation", model="MrezaPRZ/CodeLlama-3x7B-dialect-experts-base", device_map="auto")

# Load model directly
from transformers import AutoTokenizer, AutoModelForCausalLM

tokenizer = AutoTokenizer.from_pretrained("MrezaPRZ/CodeLlama-3x7B-dialect-experts-base")
model = AutoModelForCausalLM.from_pretrained("MrezaPRZ/CodeLlama-3x7B-dialect-experts-base", device_map="auto")

Notebooks
Google Colab
Kaggle
Local Apps Settings

vLLM

How to use MrezaPRZ/CodeLlama-3x7B-dialect-experts-base with vLLM:

Install from pip and serve model

# Install vLLM from pip:
pip install vllm
# Start the vLLM server:
vllm serve "MrezaPRZ/CodeLlama-3x7B-dialect-experts-base"
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:8000/v1/completions" \
	-H "Content-Type: application/json" \
	--data '{
		"model": "MrezaPRZ/CodeLlama-3x7B-dialect-experts-base",
		"prompt": "Once upon a time,",
		"max_tokens": 512,
		"temperature": 0.5
	}'

Use Docker

docker model run hf.co/MrezaPRZ/CodeLlama-3x7B-dialect-experts-base

SGLang

How to use MrezaPRZ/CodeLlama-3x7B-dialect-experts-base with SGLang:

Install from pip and serve model

# Install SGLang from pip:
pip install sglang
# Start the SGLang server:
python3 -m sglang.launch_server \
    --model-path "MrezaPRZ/CodeLlama-3x7B-dialect-experts-base" \
    --host 0.0.0.0 \
    --port 30000
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:30000/v1/completions" \
	-H "Content-Type: application/json" \
	--data '{
		"model": "MrezaPRZ/CodeLlama-3x7B-dialect-experts-base",
		"prompt": "Once upon a time,",
		"max_tokens": 512,
		"temperature": 0.5
	}'

Use Docker images

docker run --gpus all \
    --shm-size 32g \
    -p 30000:30000 \
    -v ~/.cache/huggingface:/root/.cache/huggingface \
    --env "HF_TOKEN=<secret>" \
    --ipc=host \
    lmsysorg/sglang:latest \
    python3 -m sglang.launch_server \
        --model-path "MrezaPRZ/CodeLlama-3x7B-dialect-experts-base" \
        --host 0.0.0.0 \
        --port 30000
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:30000/v1/completions" \
	-H "Content-Type: application/json" \
	--data '{
		"model": "MrezaPRZ/CodeLlama-3x7B-dialect-experts-base",
		"prompt": "Once upon a time,",
		"max_tokens": 512,
		"temperature": 0.5
	}'

Docker Model Runner
How to use MrezaPRZ/CodeLlama-3x7B-dialect-experts-base with Docker Model Runner:
```
docker model run hf.co/MrezaPRZ/CodeLlama-3x7B-dialect-experts-base
```

MrezaPRZ commited on Jun 4, 2024

Commit

5d00b2c

verified ·

1 Parent(s): ce8a3d1

Upload folder using huggingface_hub

Browse files

Files changed (11) hide show

.ipynb_checkpoints/config-checkpoint.json +35 -0
config.json +35 -0
mergekit_moe_config.yml +194 -0
model-00001-of-00004.safetensors +3 -0
model-00002-of-00004.safetensors +3 -0
model-00003-of-00004.safetensors +3 -0
model-00004-of-00004.safetensors +3 -0
model.safetensors.index.json +1 -0
special_tokens_map.json +34 -0
tokenizer.json +0 -0
tokenizer_config.json +91 -0

.ipynb_checkpoints/config-checkpoint.json ADDED Viewed

	@@ -0,0 +1,35 @@

+{
+  "_name_or_path": "MrezaPRZ/codellama_high_quality_sft",
+  "architectures": [
+    "MixtralForCausalLM"
+  ],
+  "attention_bias": false,
+  "attention_dropout": 0.0,
+  "bos_token_id": 1,
+  "eos_token_id": 2,
+  "hidden_act": "silu",
+  "hidden_size": 4096,
+  "initializer_range": 0.02,
+  "intermediate_size": 11008,
+  "max_position_embeddings": 16384,
+  "mlp_bias": false,
+  "model_type": "mixtral",
+  "num_attention_heads": 32,
+  "num_experts_per_tok": 2,
+  "num_hidden_layers": 32,
+  "num_key_value_heads": 32,
+  "num_local_experts": 3,
+  "output_router_logits": false,
+  "pretraining_tp": 1,
+  "rms_norm_eps": 1e-05,
+  "rope_scaling": null,
+  "rope_theta": 1000000,
+  "router_aux_loss_coef": 0.001,
+  "router_jitter_noise": 0.0,
+  "sliding_window": null,
+  "tie_word_embeddings": false,
+  "torch_dtype": "bfloat16",
+  "transformers_version": "4.41.2",
+  "use_cache": true,
+  "vocab_size": 32016
+}

config.json ADDED Viewed

	@@ -0,0 +1,35 @@

+{
+  "_name_or_path": "MrezaPRZ/codellama_high_quality_sft",
+  "architectures": [
+    "MixtralForCausalLM"
+  ],
+  "attention_bias": false,
+  "attention_dropout": 0.0,
+  "bos_token_id": 1,
+  "eos_token_id": 2,
+  "hidden_act": "silu",
+  "hidden_size": 4096,
+  "initializer_range": 0.02,
+  "intermediate_size": 11008,
+  "max_position_embeddings": 16384,
+  "mlp_bias": false,
+  "model_type": "mixtral",
+  "num_attention_heads": 32,
+  "num_experts_per_tok": 2,
+  "num_hidden_layers": 32,
+  "num_key_value_heads": 32,
+  "num_local_experts": 3,
+  "output_router_logits": false,
+  "pretraining_tp": 1,
+  "rms_norm_eps": 1e-05,
+  "rope_scaling": null,
+  "rope_theta": 1000000,
+  "router_aux_loss_coef": 0.001,
+  "router_jitter_noise": 0.0,
+  "sliding_window": null,
+  "tie_word_embeddings": false,
+  "torch_dtype": "bfloat16",
+  "transformers_version": "4.41.2",
+  "use_cache": true,
+  "vocab_size": 32016
+}

mergekit_moe_config.yml ADDED Viewed

	@@ -0,0 +1,194 @@

+base_model: MrezaPRZ/codellama_high_quality_sft
+dtype: bfloat16
+gate_mode: hidden
+experts:
+  - source_model: MrezaPRZ/codellama_high_quality_sft
+    positive_prompts:
+      - "sqlite"
+      - "AUTOINCREMENT"
+      - "CONFLICT"
+      - "WITHOUT ROWID"
+      - "EXPLAIN"
+      - "PRAGMA"
+      - "RECURSIVE"
+      - "RAISE"
+      - "VIRTUAL"
+      - "TEMPORARY"
+      - "REGEXP"
+      - "sqlite_version()"
+      - "changes()"
+      - "last_insert_rowid()"
+      - "total_changes()"
+      - "random()"
+      - "ifnull()"
+      - "nullif()"
+      - "sqlite_compileoption_used()"
+      - "sqlite_compileoption_get()"
+      - "sqlite_source_id()"
+      - "sqlite_log()"
+      - "sqlite3_limit()"
+      - "json()"
+      - "json_array()"
+      - "json_array_length()"
+      - "json_extract()"
+      - "json_insert()"
+      - "json_object()"
+      - "json_patch()"
+      - "json_remove()"
+      - "json_replace()"
+      - "json_set()"
+      - "json_type()"
+      - "json_valid()"
+      - "fts3()"
+      - "fts4()"
+      - "fts5()"
+      - "printf()"
+      - "soundex()"
+      - "typeof()"
+  - source_model: MrezaPRZ/codellama_high_quality_sft_postgres
+    positive_prompts:
+      - "postgres"
+      - "DO"
+      - "RETURNING"
+      - "TABLESAMPLE"
+      - "WITH ORDINALITY"
+      - "SERIAL"
+      - "BIGSERIAL"
+      - "SMALLSERIAL"
+      - "TSQUERY"
+      - "TSVECTOR"
+      - "JSONB"
+      - "GIN"
+      - "GIST"
+      - "REGCLASS"
+      - "HSTORE"
+      - "LATERAL"
+      - "UNLOGGED"
+      - "CTID"
+      - "XMIN"
+      - "XMAX"
+      - "CUBE"
+      - "RANGE"
+      - "TO_TSVECTOR()"
+      - "TO_TSQUERY()"
+      - "PLPGSQL()"
+      - "TS_RANK()"
+      - "TS_RANK_CD()"
+      - "WEBSEARCH_TO_TSQUERY()"
+      - "SETWEIGHT()"
+      - "ARRAY_TO_STRING()"
+      - "STRING_TO_ARRAY()"
+      - "ARRAY_APPEND()"
+      - "ARRAY_PREPEND()"
+      - "ARRAY_REMOVE()"
+      - "ARRAY_REPLACE()"
+      - "STRING_AGG()"
+      - "JSON_BUILD_OBJECT()"
+      - "JSONB_BUILD_OBJECT()"
+      - "JSONB_SET()"
+      - "JSONB_INSERT()"
+      - "JSONB_PRETTY()"
+      - "TO_JSON()"
+      - "TO_JSONB()"
+      - "JSON_OBJECT()"
+      - "JSONB_OBJECT()"
+      - "JSON_AGG()"
+      - "JSONB_AGG()"
+      - "ROW_TO_JSON()"
+      - "XMLEXISTS()"
+      - "XMLCONCAT()"
+      - "XMLFOREST()"
+      - "XMLPARSE()"
+      - "XMLPI()"
+      - "XMLROOT()"
+      - "XMLSERIALIZE()"
+      - "PLV8()"
+      - "HSTORE()"
+      - "LQUERY()"
+      - "LTREE()"
+      - "LTXTQUERY()"
+  - source_model: MrezaPRZ/codellama_high_quality_sft_bigquery
+    positive_prompts:
+      - "bigquery"
+      - "ARRAY"
+      - "STRUCT"
+      - "UNNEST"
+      - "WITHIN"
+      - "QUALIFY"
+      - "WINDOW"
+      - "OVER"
+      - "ANY_VALUE"
+      - "APPROX_COUNT_DISTINCT"
+      - "APPROX_QUANTILES"
+      - "APPROX_TOP_COUNT"
+      - "ARRAY_AGG"
+      - "ARRAY_CONCAT_AGG"
+      - "ARRAY_LENGTH"
+      - "ARRAY_TO_STRING"
+      - "SAFE_CAST"
+      - "SAFE_DIVIDE"
+      - "SAFE_MULTIPLY"
+      - "SAFE_OFFSET"
+      - "SAFE_ORDINAL"
+      - "BIT_XOR"
+      - "CORR"
+      - "COVAR_POP"
+      - "COVAR_SAMP"
+      - "CUME_DIST"
+      - "DENSE_RANK"
+      - "DISTINCT"
+      - "FIRST_VALUE"
+      - "LAG"
+      - "LAST_VALUE"
+      - "LEAD"
+      - "NTH_VALUE"
+      - "NTILE"
+      - "PERCENT_RANK"
+      - "PERCENTILE_CONT"
+      - "PERCENTILE_DISC"
+      - "RANK"
+      - "RATIO_TO_REPORT"
+      - "REGR_INTERCEPT"
+      - "REGR_SLOPE"
+      - "ST_GEOGPOINT"
+      - "ST_GEOGFROMTEXT"
+      - "ST_GEOGFROMWKB"
+      - "ST_ASGEOJSON"
+      - "ST_ASTEXT"
+      - "ST_DISTANCE"
+      - "ST_INTERSECTS"
+      - "ST_UNION_AGG"
+      - "TIMESTAMP_TRUNC"
+      - "TIMESTAMP_DIFF"
+      - "TIMESTAMP_SUB"
+      - "TIMESTAMP_ADD"
+      - "TIMESTAMP_SECONDS"
+      - "TIMESTAMP_MILLIS"
+      - "TIMESTAMP_MICROS"
+      - "UNNEST"
+      - "ARRAY()"
+      - "ARRAY_AGG()"
+      - "ARRAY_TO_STRING()"
+      - "STRUCT()"
+      - "SAFE_CAST()"
+      - "SAFE_DIVIDE()"
+      - "SAFE_MULTIPLY()"
+      - "SAFE_OFFSET()"
+      - "SAFE_ORDINAL()"
+      - "BIT_XOR()"
+      - "ST_GEOGPOINT()"
+      - "ST_GEOGFROMTEXT()"
+      - "ST_GEOGFROMWKB()"
+      - "ST_ASGEOJSON()"
+      - "ST_ASTEXT()"
+      - "ST_DISTANCE()"
+      - "ST_INTERSECTS()"
+      - "ST_UNION_AGG()"
+      - "TIMESTAMP_TRUNC()"
+      - "TIMESTAMP_DIFF()"
+      - "TIMESTAMP_SUB()"
+      - "TIMESTAMP_ADD()"
+      - "TIMESTAMP_SECONDS()"
+      - "TIMESTAMP_MILLIS()"
+      - "TIMESTAMP_MICROS()"

model-00001-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:3f896ea5904784540cc2a23cce886e2ef438ff34ac8741d853c34a57def2cf67
+size 9945025816

model-00002-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f1cc139e694f3413ad4752adb605e8a470282eaf1a4622e0d31cf8596923705e
+size 9999404312

model-00003-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f637084c897c50c393726e0219b19dbeef25a9b39ae202f205760cefcd625a7a
+size 9953283784

model-00004-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:72c8640b26c8f39a2a5dafdd35d8a6a01e1c1803b7b42ed4fcfc682105d56905
+size 894317344

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1 @@

+ {"metadata": {"mergekit_version": "0.0.4.2", "total_size": 30791966720}, "weight_map": {"model.embed_tokens.weight": "model-00001-of-00004.safetensors", "model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.0.block_sparse_moe.experts.0.w3.weight": "model-00001-of-00004.safetensors", "model.layers.0.block_sparse_moe.experts.1.w3.weight": "model-00001-of-00004.safetensors", "model.layers.0.block_sparse_moe.experts.2.w3.weight": "model-00001-of-00004.safetensors", "model.layers.0.block_sparse_moe.experts.0.w1.weight": "model-00001-of-00004.safetensors", "model.layers.0.block_sparse_moe.experts.1.w1.weight": "model-00001-of-00004.safetensors", "model.layers.0.block_sparse_moe.experts.2.w1.weight": "model-00001-of-00004.safetensors", "model.layers.0.block_sparse_moe.experts.0.w2.weight": "model-00001-of-00004.safetensors", "model.layers.0.block_sparse_moe.experts.1.w2.weight": "model-00001-of-00004.safetensors", "model.layers.0.block_sparse_moe.experts.2.w2.weight": "model-00001-of-00004.safetensors", "model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.1.block_sparse_moe.experts.0.w3.weight": "model-00001-of-00004.safetensors", "model.layers.1.block_sparse_moe.experts.1.w3.weight": "model-00001-of-00004.safetensors", "model.layers.1.block_sparse_moe.experts.2.w3.weight": "model-00001-of-00004.safetensors", "model.layers.1.block_sparse_moe.experts.0.w1.weight": "model-00001-of-00004.safetensors", "model.layers.1.block_sparse_moe.experts.1.w1.weight": "model-00001-of-00004.safetensors", "model.layers.1.block_sparse_moe.experts.2.w1.weight": "model-00001-of-00004.safetensors", "model.layers.1.block_sparse_moe.experts.0.w2.weight": "model-00001-of-00004.safetensors", "model.layers.1.block_sparse_moe.experts.1.w2.weight": "model-00001-of-00004.safetensors", "model.layers.1.block_sparse_moe.experts.2.w2.weight": "model-00001-of-00004.safetensors", "model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.2.block_sparse_moe.experts.0.w3.weight": "model-00001-of-00004.safetensors", "model.layers.2.block_sparse_moe.experts.1.w3.weight": "model-00001-of-00004.safetensors", "model.layers.2.block_sparse_moe.experts.2.w3.weight": "model-00001-of-00004.safetensors", "model.layers.2.block_sparse_moe.experts.0.w1.weight": "model-00001-of-00004.safetensors", "model.layers.2.block_sparse_moe.experts.1.w1.weight": "model-00001-of-00004.safetensors", "model.layers.2.block_sparse_moe.experts.2.w1.weight": "model-00001-of-00004.safetensors", "model.layers.2.block_sparse_moe.experts.0.w2.weight": "model-00001-of-00004.safetensors", "model.layers.2.block_sparse_moe.experts.1.w2.weight": "model-00001-of-00004.safetensors", "model.layers.2.block_sparse_moe.experts.2.w2.weight": "model-00001-of-00004.safetensors", "model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.3.block_sparse_moe.experts.0.w3.weight": "model-00001-of-00004.safetensors", "model.layers.3.block_sparse_moe.experts.1.w3.weight": "model-00001-of-00004.safetensors", "model.layers.3.block_sparse_moe.experts.2.w3.weight": "model-00001-of-00004.safetensors", "model.layers.3.block_sparse_moe.experts.0.w1.weight": "model-00001-of-00004.safetensors", "model.layers.3.block_sparse_moe.experts.1.w1.weight": "model-00001-of-00004.safetensors", "model.layers.3.block_sparse_moe.experts.2.w1.weight": "model-00001-of-00004.safetensors", "model.layers.3.block_sparse_moe.experts.0.w2.weight": "model-00001-of-00004.safetensors", "model.layers.3.block_sparse_moe.experts.1.w2.weight": "model-00001-of-00004.safetensors", "model.layers.3.block_sparse_moe.experts.2.w2.weight": "model-00001-of-00004.safetensors", "model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.4.block_sparse_moe.experts.0.w3.weight": "model-00001-of-00004.safetensors", "model.layers.4.block_sparse_moe.experts.1.w3.weight": "model-00001-of-00004.safetensors", "model.layers.4.block_sparse_moe.experts.2.w3.weight": "model-00001-of-00004.safetensors", "model.layers.4.block_sparse_moe.experts.0.w1.weight": "model-00001-of-00004.safetensors", "model.layers.4.block_sparse_moe.experts.1.w1.weight": "model-00001-of-00004.safetensors", "model.layers.4.block_sparse_moe.experts.2.w1.weight": "model-00001-of-00004.safetensors", "model.layers.4.block_sparse_moe.experts.0.w2.weight": "model-00001-of-00004.safetensors", "model.layers.4.block_sparse_moe.experts.1.w2.weight": "model-00001-of-00004.safetensors", "model.layers.4.block_sparse_moe.experts.2.w2.weight": "model-00001-of-00004.safetensors", "model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.5.block_sparse_moe.experts.0.w3.weight": "model-00001-of-00004.safetensors", "model.layers.5.block_sparse_moe.experts.1.w3.weight": "model-00001-of-00004.safetensors", "model.layers.5.block_sparse_moe.experts.2.w3.weight": "model-00001-of-00004.safetensors", "model.layers.5.block_sparse_moe.experts.0.w1.weight": "model-00001-of-00004.safetensors", "model.layers.5.block_sparse_moe.experts.1.w1.weight": "model-00001-of-00004.safetensors", "model.layers.5.block_sparse_moe.experts.2.w1.weight": "model-00001-of-00004.safetensors", "model.layers.5.block_sparse_moe.experts.0.w2.weight": "model-00001-of-00004.safetensors", "model.layers.5.block_sparse_moe.experts.1.w2.weight": "model-00001-of-00004.safetensors", "model.layers.5.block_sparse_moe.experts.2.w2.weight": "model-00001-of-00004.safetensors", "model.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.6.block_sparse_moe.experts.0.w3.weight": "model-00001-of-00004.safetensors", "model.layers.6.block_sparse_moe.experts.1.w3.weight": "model-00001-of-00004.safetensors", "model.layers.6.block_sparse_moe.experts.2.w3.weight": "model-00001-of-00004.safetensors", "model.layers.6.block_sparse_moe.experts.0.w1.weight": "model-00001-of-00004.safetensors", "model.layers.6.block_sparse_moe.experts.1.w1.weight": "model-00001-of-00004.safetensors", "model.layers.6.block_sparse_moe.experts.2.w1.weight": "model-00001-of-00004.safetensors", "model.layers.6.block_sparse_moe.experts.0.w2.weight": "model-00001-of-00004.safetensors", "model.layers.6.block_sparse_moe.experts.1.w2.weight": "model-00001-of-00004.safetensors", "model.layers.6.block_sparse_moe.experts.2.w2.weight": "model-00001-of-00004.safetensors", "model.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.7.block_sparse_moe.experts.0.w3.weight": "model-00001-of-00004.safetensors", "model.layers.7.block_sparse_moe.experts.1.w3.weight": "model-00001-of-00004.safetensors", "model.layers.7.block_sparse_moe.experts.2.w3.weight": "model-00001-of-00004.safetensors", "model.layers.7.block_sparse_moe.experts.0.w1.weight": "model-00001-of-00004.safetensors", "model.layers.7.block_sparse_moe.experts.1.w1.weight": "model-00001-of-00004.safetensors", "model.layers.7.block_sparse_moe.experts.2.w1.weight": "model-00001-of-00004.safetensors", "model.layers.7.block_sparse_moe.experts.0.w2.weight": "model-00001-of-00004.safetensors", "model.layers.7.block_sparse_moe.experts.1.w2.weight": "model-00001-of-00004.safetensors", "model.layers.7.block_sparse_moe.experts.2.w2.weight": "model-00001-of-00004.safetensors", "model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.8.block_sparse_moe.experts.0.w3.weight": "model-00001-of-00004.safetensors", "model.layers.8.block_sparse_moe.experts.1.w3.weight": "model-00001-of-00004.safetensors", "model.layers.8.block_sparse_moe.experts.2.w3.weight": "model-00001-of-00004.safetensors", "model.layers.8.block_sparse_moe.experts.0.w1.weight": "model-00001-of-00004.safetensors", "model.layers.8.block_sparse_moe.experts.1.w1.weight": "model-00001-of-00004.safetensors", "model.layers.8.block_sparse_moe.experts.2.w1.weight": "model-00001-of-00004.safetensors", "model.layers.8.block_sparse_moe.experts.0.w2.weight": "model-00001-of-00004.safetensors", "model.layers.8.block_sparse_moe.experts.1.w2.weight": "model-00001-of-00004.safetensors", "model.layers.8.block_sparse_moe.experts.2.w2.weight": "model-00001-of-00004.safetensors", "model.layers.9.input_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.9.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", "model.layers.9.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", "model.layers.9.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", "model.layers.9.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", "model.layers.9.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.9.block_sparse_moe.experts.0.w3.weight": "model-00001-of-00004.safetensors", "model.layers.9.block_sparse_moe.experts.1.w3.weight": "model-00001-of-00004.safetensors", "model.layers.9.block_sparse_moe.experts.2.w3.weight": "model-00001-of-00004.safetensors", "model.layers.9.block_sparse_moe.experts.0.w1.weight": "model-00001-of-00004.safetensors", "model.layers.9.block_sparse_moe.experts.1.w1.weight": "model-00001-of-00004.safetensors", "model.layers.9.block_sparse_moe.experts.2.w1.weight": "model-00001-of-00004.safetensors", "model.layers.9.block_sparse_moe.experts.0.w2.weight": "model-00001-of-00004.safetensors", "model.layers.9.block_sparse_moe.experts.1.w2.weight": "model-00001-of-00004.safetensors", "model.layers.9.block_sparse_moe.experts.2.w2.weight": "model-00001-of-00004.safetensors", "model.layers.10.input_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.10.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", "model.layers.10.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", "model.layers.10.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", "model.layers.10.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", "model.layers.10.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", "model.layers.10.block_sparse_moe.experts.0.w3.weight": "model-00001-of-00004.safetensors", "model.layers.10.block_sparse_moe.experts.1.w3.weight": "model-00002-of-00004.safetensors", "model.layers.10.block_sparse_moe.experts.2.w3.weight": "model-00002-of-00004.safetensors", "model.layers.10.block_sparse_moe.experts.0.w1.weight": "model-00002-of-00004.safetensors", "model.layers.10.block_sparse_moe.experts.1.w1.weight": "model-00002-of-00004.safetensors", "model.layers.10.block_sparse_moe.experts.2.w1.weight": "model-00002-of-00004.safetensors", "model.layers.10.block_sparse_moe.experts.0.w2.weight": "model-00002-of-00004.safetensors", "model.layers.10.block_sparse_moe.experts.1.w2.weight": "model-00002-of-00004.safetensors", "model.layers.10.block_sparse_moe.experts.2.w2.weight": "model-00002-of-00004.safetensors", "model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.11.block_sparse_moe.experts.0.w3.weight": "model-00002-of-00004.safetensors", "model.layers.11.block_sparse_moe.experts.1.w3.weight": "model-00002-of-00004.safetensors", "model.layers.11.block_sparse_moe.experts.2.w3.weight": "model-00002-of-00004.safetensors", "model.layers.11.block_sparse_moe.experts.0.w1.weight": "model-00002-of-00004.safetensors", "model.layers.11.block_sparse_moe.experts.1.w1.weight": "model-00002-of-00004.safetensors", "model.layers.11.block_sparse_moe.experts.2.w1.weight": "model-00002-of-00004.safetensors", "model.layers.11.block_sparse_moe.experts.0.w2.weight": "model-00002-of-00004.safetensors", "model.layers.11.block_sparse_moe.experts.1.w2.weight": "model-00002-of-00004.safetensors", "model.layers.11.block_sparse_moe.experts.2.w2.weight": "model-00002-of-00004.safetensors", "model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.12.block_sparse_moe.experts.0.w3.weight": "model-00002-of-00004.safetensors", "model.layers.12.block_sparse_moe.experts.1.w3.weight": "model-00002-of-00004.safetensors", "model.layers.12.block_sparse_moe.experts.2.w3.weight": "model-00002-of-00004.safetensors", "model.layers.12.block_sparse_moe.experts.0.w1.weight": "model-00002-of-00004.safetensors", "model.layers.12.block_sparse_moe.experts.1.w1.weight": "model-00002-of-00004.safetensors", "model.layers.12.block_sparse_moe.experts.2.w1.weight": "model-00002-of-00004.safetensors", "model.layers.12.block_sparse_moe.experts.0.w2.weight": "model-00002-of-00004.safetensors", "model.layers.12.block_sparse_moe.experts.1.w2.weight": "model-00002-of-00004.safetensors", "model.layers.12.block_sparse_moe.experts.2.w2.weight": "model-00002-of-00004.safetensors", "model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.13.block_sparse_moe.experts.0.w3.weight": "model-00002-of-00004.safetensors", "model.layers.13.block_sparse_moe.experts.1.w3.weight": "model-00002-of-00004.safetensors", "model.layers.13.block_sparse_moe.experts.2.w3.weight": "model-00002-of-00004.safetensors", "model.layers.13.block_sparse_moe.experts.0.w1.weight": "model-00002-of-00004.safetensors", "model.layers.13.block_sparse_moe.experts.1.w1.weight": "model-00002-of-00004.safetensors", "model.layers.13.block_sparse_moe.experts.2.w1.weight": "model-00002-of-00004.safetensors", "model.layers.13.block_sparse_moe.experts.0.w2.weight": "model-00002-of-00004.safetensors", "model.layers.13.block_sparse_moe.experts.1.w2.weight": "model-00002-of-00004.safetensors", "model.layers.13.block_sparse_moe.experts.2.w2.weight": "model-00002-of-00004.safetensors", "model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.14.block_sparse_moe.experts.0.w3.weight": "model-00002-of-00004.safetensors", "model.layers.14.block_sparse_moe.experts.1.w3.weight": "model-00002-of-00004.safetensors", "model.layers.14.block_sparse_moe.experts.2.w3.weight": "model-00002-of-00004.safetensors", "model.layers.14.block_sparse_moe.experts.0.w1.weight": "model-00002-of-00004.safetensors", "model.layers.14.block_sparse_moe.experts.1.w1.weight": "model-00002-of-00004.safetensors", "model.layers.14.block_sparse_moe.experts.2.w1.weight": "model-00002-of-00004.safetensors", "model.layers.14.block_sparse_moe.experts.0.w2.weight": "model-00002-of-00004.safetensors", "model.layers.14.block_sparse_moe.experts.1.w2.weight": "model-00002-of-00004.safetensors", "model.layers.14.block_sparse_moe.experts.2.w2.weight": "model-00002-of-00004.safetensors", "model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.15.block_sparse_moe.experts.0.w3.weight": "model-00002-of-00004.safetensors", "model.layers.15.block_sparse_moe.experts.1.w3.weight": "model-00002-of-00004.safetensors", "model.layers.15.block_sparse_moe.experts.2.w3.weight": "model-00002-of-00004.safetensors", "model.layers.15.block_sparse_moe.experts.0.w1.weight": "model-00002-of-00004.safetensors", "model.layers.15.block_sparse_moe.experts.1.w1.weight": "model-00002-of-00004.safetensors", "model.layers.15.block_sparse_moe.experts.2.w1.weight": "model-00002-of-00004.safetensors", "model.layers.15.block_sparse_moe.experts.0.w2.weight": "model-00002-of-00004.safetensors", "model.layers.15.block_sparse_moe.experts.1.w2.weight": "model-00002-of-00004.safetensors", "model.layers.15.block_sparse_moe.experts.2.w2.weight": "model-00002-of-00004.safetensors", "model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.16.block_sparse_moe.experts.0.w3.weight": "model-00002-of-00004.safetensors", "model.layers.16.block_sparse_moe.experts.1.w3.weight": "model-00002-of-00004.safetensors", "model.layers.16.block_sparse_moe.experts.2.w3.weight": "model-00002-of-00004.safetensors", "model.layers.16.block_sparse_moe.experts.0.w1.weight": "model-00002-of-00004.safetensors", "model.layers.16.block_sparse_moe.experts.1.w1.weight": "model-00002-of-00004.safetensors", "model.layers.16.block_sparse_moe.experts.2.w1.weight": "model-00002-of-00004.safetensors", "model.layers.16.block_sparse_moe.experts.0.w2.weight": "model-00002-of-00004.safetensors", "model.layers.16.block_sparse_moe.experts.1.w2.weight": "model-00002-of-00004.safetensors", "model.layers.16.block_sparse_moe.experts.2.w2.weight": "model-00002-of-00004.safetensors", "model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.17.block_sparse_moe.experts.0.w3.weight": "model-00002-of-00004.safetensors", "model.layers.17.block_sparse_moe.experts.1.w3.weight": "model-00002-of-00004.safetensors", "model.layers.17.block_sparse_moe.experts.2.w3.weight": "model-00002-of-00004.safetensors", "model.layers.17.block_sparse_moe.experts.0.w1.weight": "model-00002-of-00004.safetensors", "model.layers.17.block_sparse_moe.experts.1.w1.weight": "model-00002-of-00004.safetensors", "model.layers.17.block_sparse_moe.experts.2.w1.weight": "model-00002-of-00004.safetensors", "model.layers.17.block_sparse_moe.experts.0.w2.weight": "model-00002-of-00004.safetensors", "model.layers.17.block_sparse_moe.experts.1.w2.weight": "model-00002-of-00004.safetensors", "model.layers.17.block_sparse_moe.experts.2.w2.weight": "model-00002-of-00004.safetensors", "model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.18.block_sparse_moe.experts.0.w3.weight": "model-00002-of-00004.safetensors", "model.layers.18.block_sparse_moe.experts.1.w3.weight": "model-00002-of-00004.safetensors", "model.layers.18.block_sparse_moe.experts.2.w3.weight": "model-00002-of-00004.safetensors", "model.layers.18.block_sparse_moe.experts.0.w1.weight": "model-00002-of-00004.safetensors", "model.layers.18.block_sparse_moe.experts.1.w1.weight": "model-00002-of-00004.safetensors", "model.layers.18.block_sparse_moe.experts.2.w1.weight": "model-00002-of-00004.safetensors", "model.layers.18.block_sparse_moe.experts.0.w2.weight": "model-00002-of-00004.safetensors", "model.layers.18.block_sparse_moe.experts.1.w2.weight": "model-00002-of-00004.safetensors", "model.layers.18.block_sparse_moe.experts.2.w2.weight": "model-00002-of-00004.safetensors", "model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.19.block_sparse_moe.experts.0.w3.weight": "model-00002-of-00004.safetensors", "model.layers.19.block_sparse_moe.experts.1.w3.weight": "model-00002-of-00004.safetensors", "model.layers.19.block_sparse_moe.experts.2.w3.weight": "model-00002-of-00004.safetensors", "model.layers.19.block_sparse_moe.experts.0.w1.weight": "model-00002-of-00004.safetensors", "model.layers.19.block_sparse_moe.experts.1.w1.weight": "model-00002-of-00004.safetensors", "model.layers.19.block_sparse_moe.experts.2.w1.weight": "model-00002-of-00004.safetensors", "model.layers.19.block_sparse_moe.experts.0.w2.weight": "model-00002-of-00004.safetensors", "model.layers.19.block_sparse_moe.experts.1.w2.weight": "model-00002-of-00004.safetensors", "model.layers.19.block_sparse_moe.experts.2.w2.weight": "model-00002-of-00004.safetensors", "model.layers.20.input_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", "model.layers.20.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", "model.layers.20.block_sparse_moe.experts.0.w3.weight": "model-00002-of-00004.safetensors", "model.layers.20.block_sparse_moe.experts.1.w3.weight": "model-00002-of-00004.safetensors", "model.layers.20.block_sparse_moe.experts.2.w3.weight": "model-00002-of-00004.safetensors", "model.layers.20.block_sparse_moe.experts.0.w1.weight": "model-00002-of-00004.safetensors", "model.layers.20.block_sparse_moe.experts.1.w1.weight": "model-00002-of-00004.safetensors", "model.layers.20.block_sparse_moe.experts.2.w1.weight": "model-00002-of-00004.safetensors", "model.layers.20.block_sparse_moe.experts.0.w2.weight": "model-00002-of-00004.safetensors", "model.layers.20.block_sparse_moe.experts.1.w2.weight": "model-00003-of-00004.safetensors", "model.layers.20.block_sparse_moe.experts.2.w2.weight": "model-00003-of-00004.safetensors", "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.21.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", "model.layers.21.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", "model.layers.21.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", "model.layers.21.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", "model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.21.block_sparse_moe.experts.0.w3.weight": "model-00003-of-00004.safetensors", "model.layers.21.block_sparse_moe.experts.1.w3.weight": "model-00003-of-00004.safetensors", "model.layers.21.block_sparse_moe.experts.2.w3.weight": "model-00003-of-00004.safetensors", "model.layers.21.block_sparse_moe.experts.0.w1.weight": "model-00003-of-00004.safetensors", "model.layers.21.block_sparse_moe.experts.1.w1.weight": "model-00003-of-00004.safetensors", "model.layers.21.block_sparse_moe.experts.2.w1.weight": "model-00003-of-00004.safetensors", "model.layers.21.block_sparse_moe.experts.0.w2.weight": "model-00003-of-00004.safetensors", "model.layers.21.block_sparse_moe.experts.1.w2.weight": "model-00003-of-00004.safetensors", "model.layers.21.block_sparse_moe.experts.2.w2.weight": "model-00003-of-00004.safetensors", "model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.22.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", "model.layers.22.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", "model.layers.22.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", "model.layers.22.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", "model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.22.block_sparse_moe.experts.0.w3.weight": "model-00003-of-00004.safetensors", "model.layers.22.block_sparse_moe.experts.1.w3.weight": "model-00003-of-00004.safetensors", "model.layers.22.block_sparse_moe.experts.2.w3.weight": "model-00003-of-00004.safetensors", "model.layers.22.block_sparse_moe.experts.0.w1.weight": "model-00003-of-00004.safetensors", "model.layers.22.block_sparse_moe.experts.1.w1.weight": "model-00003-of-00004.safetensors", "model.layers.22.block_sparse_moe.experts.2.w1.weight": "model-00003-of-00004.safetensors", "model.layers.22.block_sparse_moe.experts.0.w2.weight": "model-00003-of-00004.safetensors", "model.layers.22.block_sparse_moe.experts.1.w2.weight": "model-00003-of-00004.safetensors", "model.layers.22.block_sparse_moe.experts.2.w2.weight": "model-00003-of-00004.safetensors", "model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", "model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", "model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", "model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", "model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.23.block_sparse_moe.experts.0.w3.weight": "model-00003-of-00004.safetensors", "model.layers.23.block_sparse_moe.experts.1.w3.weight": "model-00003-of-00004.safetensors", "model.layers.23.block_sparse_moe.experts.2.w3.weight": "model-00003-of-00004.safetensors", "model.layers.23.block_sparse_moe.experts.0.w1.weight": "model-00003-of-00004.safetensors", "model.layers.23.block_sparse_moe.experts.1.w1.weight": "model-00003-of-00004.safetensors", "model.layers.23.block_sparse_moe.experts.2.w1.weight": "model-00003-of-00004.safetensors", "model.layers.23.block_sparse_moe.experts.0.w2.weight": "model-00003-of-00004.safetensors", "model.layers.23.block_sparse_moe.experts.1.w2.weight": "model-00003-of-00004.safetensors", "model.layers.23.block_sparse_moe.experts.2.w2.weight": "model-00003-of-00004.safetensors", "model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", "model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", "model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", "model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", "model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.24.block_sparse_moe.experts.0.w3.weight": "model-00003-of-00004.safetensors", "model.layers.24.block_sparse_moe.experts.1.w3.weight": "model-00003-of-00004.safetensors", "model.layers.24.block_sparse_moe.experts.2.w3.weight": "model-00003-of-00004.safetensors", "model.layers.24.block_sparse_moe.experts.0.w1.weight": "model-00003-of-00004.safetensors", "model.layers.24.block_sparse_moe.experts.1.w1.weight": "model-00003-of-00004.safetensors", "model.layers.24.block_sparse_moe.experts.2.w1.weight": "model-00003-of-00004.safetensors", "model.layers.24.block_sparse_moe.experts.0.w2.weight": "model-00003-of-00004.safetensors", "model.layers.24.block_sparse_moe.experts.1.w2.weight": "model-00003-of-00004.safetensors", "model.layers.24.block_sparse_moe.experts.2.w2.weight": "model-00003-of-00004.safetensors", "model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", "model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", "model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", "model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", "model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.25.block_sparse_moe.experts.0.w3.weight": "model-00003-of-00004.safetensors", "model.layers.25.block_sparse_moe.experts.1.w3.weight": "model-00003-of-00004.safetensors", "model.layers.25.block_sparse_moe.experts.2.w3.weight": "model-00003-of-00004.safetensors", "model.layers.25.block_sparse_moe.experts.0.w1.weight": "model-00003-of-00004.safetensors", "model.layers.25.block_sparse_moe.experts.1.w1.weight": "model-00003-of-00004.safetensors", "model.layers.25.block_sparse_moe.experts.2.w1.weight": "model-00003-of-00004.safetensors", "model.layers.25.block_sparse_moe.experts.0.w2.weight": "model-00003-of-00004.safetensors", "model.layers.25.block_sparse_moe.experts.1.w2.weight": "model-00003-of-00004.safetensors", "model.layers.25.block_sparse_moe.experts.2.w2.weight": "model-00003-of-00004.safetensors", "model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", "model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", "model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", "model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", "model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.26.block_sparse_moe.experts.0.w3.weight": "model-00003-of-00004.safetensors", "model.layers.26.block_sparse_moe.experts.1.w3.weight": "model-00003-of-00004.safetensors", "model.layers.26.block_sparse_moe.experts.2.w3.weight": "model-00003-of-00004.safetensors", "model.layers.26.block_sparse_moe.experts.0.w1.weight": "model-00003-of-00004.safetensors", "model.layers.26.block_sparse_moe.experts.1.w1.weight": "model-00003-of-00004.safetensors", "model.layers.26.block_sparse_moe.experts.2.w1.weight": "model-00003-of-00004.safetensors", "model.layers.26.block_sparse_moe.experts.0.w2.weight": "model-00003-of-00004.safetensors", "model.layers.26.block_sparse_moe.experts.1.w2.weight": "model-00003-of-00004.safetensors", "model.layers.26.block_sparse_moe.experts.2.w2.weight": "model-00003-of-00004.safetensors", "model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", "model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", "model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", "model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", "model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.27.block_sparse_moe.experts.0.w3.weight": "model-00003-of-00004.safetensors", "model.layers.27.block_sparse_moe.experts.1.w3.weight": "model-00003-of-00004.safetensors", "model.layers.27.block_sparse_moe.experts.2.w3.weight": "model-00003-of-00004.safetensors", "model.layers.27.block_sparse_moe.experts.0.w1.weight": "model-00003-of-00004.safetensors", "model.layers.27.block_sparse_moe.experts.1.w1.weight": "model-00003-of-00004.safetensors", "model.layers.27.block_sparse_moe.experts.2.w1.weight": "model-00003-of-00004.safetensors", "model.layers.27.block_sparse_moe.experts.0.w2.weight": "model-00003-of-00004.safetensors", "model.layers.27.block_sparse_moe.experts.1.w2.weight": "model-00003-of-00004.safetensors", "model.layers.27.block_sparse_moe.experts.2.w2.weight": "model-00003-of-00004.safetensors", "model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", "model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", "model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", "model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", "model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.28.block_sparse_moe.experts.0.w3.weight": "model-00003-of-00004.safetensors", "model.layers.28.block_sparse_moe.experts.1.w3.weight": "model-00003-of-00004.safetensors", "model.layers.28.block_sparse_moe.experts.2.w3.weight": "model-00003-of-00004.safetensors", "model.layers.28.block_sparse_moe.experts.0.w1.weight": "model-00003-of-00004.safetensors", "model.layers.28.block_sparse_moe.experts.1.w1.weight": "model-00003-of-00004.safetensors", "model.layers.28.block_sparse_moe.experts.2.w1.weight": "model-00003-of-00004.safetensors", "model.layers.28.block_sparse_moe.experts.0.w2.weight": "model-00003-of-00004.safetensors", "model.layers.28.block_sparse_moe.experts.1.w2.weight": "model-00003-of-00004.safetensors", "model.layers.28.block_sparse_moe.experts.2.w2.weight": "model-00003-of-00004.safetensors", "model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", "model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", "model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", "model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", "model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.29.block_sparse_moe.experts.0.w3.weight": "model-00003-of-00004.safetensors", "model.layers.29.block_sparse_moe.experts.1.w3.weight": "model-00003-of-00004.safetensors", "model.layers.29.block_sparse_moe.experts.2.w3.weight": "model-00003-of-00004.safetensors", "model.layers.29.block_sparse_moe.experts.0.w1.weight": "model-00003-of-00004.safetensors", "model.layers.29.block_sparse_moe.experts.1.w1.weight": "model-00003-of-00004.safetensors", "model.layers.29.block_sparse_moe.experts.2.w1.weight": "model-00003-of-00004.safetensors", "model.layers.29.block_sparse_moe.experts.0.w2.weight": "model-00003-of-00004.safetensors", "model.layers.29.block_sparse_moe.experts.1.w2.weight": "model-00003-of-00004.safetensors", "model.layers.29.block_sparse_moe.experts.2.w2.weight": "model-00003-of-00004.safetensors", "model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", "model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", "model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", "model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.30.block_sparse_moe.experts.0.w3.weight": "model-00003-of-00004.safetensors", "model.layers.30.block_sparse_moe.experts.1.w3.weight": "model-00003-of-00004.safetensors", "model.layers.30.block_sparse_moe.experts.2.w3.weight": "model-00003-of-00004.safetensors", "model.layers.30.block_sparse_moe.experts.0.w1.weight": "model-00003-of-00004.safetensors", "model.layers.30.block_sparse_moe.experts.1.w1.weight": "model-00003-of-00004.safetensors", "model.layers.30.block_sparse_moe.experts.2.w1.weight": "model-00003-of-00004.safetensors", "model.layers.30.block_sparse_moe.experts.0.w2.weight": "model-00003-of-00004.safetensors", "model.layers.30.block_sparse_moe.experts.1.w2.weight": "model-00003-of-00004.safetensors", "model.layers.30.block_sparse_moe.experts.2.w2.weight": "model-00003-of-00004.safetensors", "model.layers.31.input_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", "model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", "model.layers.31.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", "model.layers.31.block_sparse_moe.experts.0.w3.weight": "model-00003-of-00004.safetensors", "model.layers.31.block_sparse_moe.experts.1.w3.weight": "model-00003-of-00004.safetensors", "model.layers.31.block_sparse_moe.experts.2.w3.weight": "model-00004-of-00004.safetensors", "model.layers.31.block_sparse_moe.experts.0.w1.weight": "model-00004-of-00004.safetensors", "model.layers.31.block_sparse_moe.experts.1.w1.weight": "model-00004-of-00004.safetensors", "model.layers.31.block_sparse_moe.experts.2.w1.weight": "model-00004-of-00004.safetensors", "model.layers.31.block_sparse_moe.experts.0.w2.weight": "model-00004-of-00004.safetensors", "model.layers.31.block_sparse_moe.experts.1.w2.weight": "model-00004-of-00004.safetensors", "model.layers.31.block_sparse_moe.experts.2.w2.weight": "model-00004-of-00004.safetensors", "model.norm.weight": "model-00004-of-00004.safetensors", "lm_head.weight": "model-00004-of-00004.safetensors", "model.layers.0.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.1.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.2.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.3.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.4.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.5.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.6.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.7.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.8.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.9.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.10.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.11.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.12.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.13.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.14.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.15.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.16.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.17.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.18.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.19.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.20.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.21.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.22.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.23.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.24.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.25.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.26.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.27.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.28.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.29.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.30.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors", "model.layers.31.block_sparse_moe.gate.weight": "model-00004-of-00004.safetensors"}}

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,34 @@

+{
+  "additional_special_tokens": [
+    "▁<PRE>",
+    "▁<MID>",
+    "▁<SUF>",
+    "▁<EOT>",
+    "▁<PRE>",
+    "▁<MID>",
+    "▁<SUF>",
+    "▁<EOT>"
+  ],
+  "bos_token": {
+    "content": "<s>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "</s>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": "<s>",
+  "unk_token": {
+    "content": "<unk>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,91 @@

+{
+  "add_bos_token": true,
+  "add_eos_token": false,
+  "added_tokens_decoder": {
+    "0": {
+      "content": "<unk>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "1": {
+      "content": "<s>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "2": {
+      "content": "</s>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "32007": {
+      "content": "▁<PRE>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "32008": {
+      "content": "▁<SUF>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "32009": {
+      "content": "▁<MID>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "32010": {
+      "content": "▁<EOT>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "additional_special_tokens": [
+    "▁<PRE>",
+    "▁<MID>",
+    "▁<SUF>",
+    "▁<EOT>",
+    "▁<PRE>",
+    "▁<MID>",
+    "▁<SUF>",
+    "▁<EOT>"
+  ],
+  "bos_token": "<s>",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "</s>",
+  "eot_token": "▁<EOT>",
+  "fill_token": "<FILL_ME>",
+  "legacy": null,
+  "max_length": 1978,
+  "middle_token": "▁<MID>",
+  "model_max_length": 1000000000000000019884624838656,
+  "pad_token": "<s>",
+  "prefix_token": "▁<PRE>",
+  "sp_model_kwargs": {},
+  "stride": 0,
+  "suffix_token": "▁<SUF>",
+  "tokenizer_class": "CodeLlamaTokenizer",
+  "truncation_side": "right",
+  "truncation_strategy": "longest_first",
+  "unk_token": "<unk>",
+  "use_default_system_prompt": false
+}