Instructions to use mlx-community/gemma-4-e2b-it-8bit with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use mlx-community/gemma-4-e2b-it-8bit with MLX:
# Make sure mlx-vlm is installed # pip install --upgrade mlx-vlm from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template from mlx_vlm.utils import load_config # Load the model model, processor = load("mlx-community/gemma-4-e2b-it-8bit") config = load_config("mlx-community/gemma-4-e2b-it-8bit") # Prepare input image = ["http://images.cocodataset.org/val2017/000000039769.jpg"] prompt = "Describe this image." # Apply chat template formatted_prompt = apply_chat_template( processor, config, prompt, num_images=1 ) # Generate output output = generate(model, processor, formatted_prompt, image) print(output) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
- Pi
How to use mlx-community/gemma-4-e2b-it-8bit with Pi:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "mlx-community/gemma-4-e2b-it-8bit"
Configure the model in Pi
# Install Pi: npm install -g @mariozechner/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "mlx-lm": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "mlx-community/gemma-4-e2b-it-8bit" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Hermes Agent
How to use mlx-community/gemma-4-e2b-it-8bit with Hermes Agent:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "mlx-community/gemma-4-e2b-it-8bit"
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default mlx-community/gemma-4-e2b-it-8bit
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use mlx-community/gemma-4-e2b-it-8bit with OpenClaw:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "mlx-community/gemma-4-e2b-it-8bit"
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "mlx-community/gemma-4-e2b-it-8bit" \ --custom-provider-id mlx-lm \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
Re-upload MLX conversion from google/gemma-4-E2B-it@70af34e20bd4b7a91f0de6b22675850c43922a03
Browse files- README.md +12 -12
- config.json +18 -0
- model-00001-of-00002.safetensors +2 -2
- model-00002-of-00002.safetensors +2 -2
- model.safetensors.index.json +36 -174
- processor_config.json +21 -0
- tokenizer_config.json +42 -20
README.md
CHANGED
|
@@ -1,25 +1,25 @@
|
|
| 1 |
---
|
| 2 |
library_name: mlx
|
| 3 |
-
license:
|
| 4 |
-
|
| 5 |
-
pipeline_tag: any-to-any
|
| 6 |
-
base_model: google/gemma-4-e2b-it
|
| 7 |
tags:
|
| 8 |
- mlx
|
|
|
|
|
|
|
|
|
|
| 9 |
---
|
| 10 |
|
| 11 |
# mlx-community/gemma-4-e2b-it-8bit
|
| 12 |
|
| 13 |
-
|
| 14 |
-
using mlx-vlm version **0.4.3**.
|
| 15 |
-
Refer to the [original model card](https://huggingface.co/google/gemma-4-e2b-it) for more details on the model.
|
| 16 |
|
| 17 |
-
|
|
|
|
|
|
|
| 18 |
|
| 19 |
-
|
| 20 |
-
pip install -U mlx-vlm
|
| 21 |
-
```
|
| 22 |
|
| 23 |
```bash
|
| 24 |
-
|
|
|
|
| 25 |
```
|
|
|
|
| 1 |
---
|
| 2 |
library_name: mlx
|
| 3 |
+
license: gemma
|
| 4 |
+
base_model: google/gemma-4-E2B-it
|
|
|
|
|
|
|
| 5 |
tags:
|
| 6 |
- mlx
|
| 7 |
+
- mlx-vlm
|
| 8 |
+
- gemma4
|
| 9 |
+
- image-text-to-text
|
| 10 |
---
|
| 11 |
|
| 12 |
# mlx-community/gemma-4-e2b-it-8bit
|
| 13 |
|
| 14 |
+
MLX conversion of [google/gemma-4-E2B-it](https://huggingface.co/google/gemma-4-E2B-it) for Apple silicon.
|
|
|
|
|
|
|
| 15 |
|
| 16 |
+
- Source revision: `70af34e20bd4b7a91f0de6b22675850c43922a03`
|
| 17 |
+
- Variant: `8bit`
|
| 18 |
+
- Converted with `mlx_vlm.convert` from the local `mlx-vlm` checkout.
|
| 19 |
|
| 20 |
+
## Usage
|
|
|
|
|
|
|
| 21 |
|
| 22 |
```bash
|
| 23 |
+
pip install mlx-vlm
|
| 24 |
+
python -m mlx_vlm.generate --model mlx-community/gemma-4-e2b-it-8bit --prompt "Describe this image." --image path/to/image.jpg
|
| 25 |
```
|
config.json
CHANGED
|
@@ -45,6 +45,7 @@
|
|
| 45 |
"audio_token_id": 258881,
|
| 46 |
"boa_token_id": 256000,
|
| 47 |
"boi_token_id": 255999,
|
|
|
|
| 48 |
"dtype": "bfloat16",
|
| 49 |
"eoa_token_id": 258883,
|
| 50 |
"eoa_token_index": 258883,
|
|
@@ -54,6 +55,20 @@
|
|
| 54 |
106,
|
| 55 |
50
|
| 56 |
],
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 57 |
"image_token_id": 258880,
|
| 58 |
"initializer_range": 0.02,
|
| 59 |
"model_type": "gemma4",
|
|
@@ -67,6 +82,7 @@
|
|
| 67 |
"bits": 8,
|
| 68 |
"mode": "affine"
|
| 69 |
},
|
|
|
|
| 70 |
"text_config": {
|
| 71 |
"attention_bias": false,
|
| 72 |
"attention_dropout": 0.0,
|
|
@@ -152,6 +168,8 @@
|
|
| 152 |
"vocab_size_per_layer_input": 262144
|
| 153 |
},
|
| 154 |
"tie_word_embeddings": true,
|
|
|
|
|
|
|
| 155 |
"transformers_version": "5.5.0.dev0",
|
| 156 |
"video_token_id": 258884,
|
| 157 |
"vision_config": {
|
|
|
|
| 45 |
"audio_token_id": 258881,
|
| 46 |
"boa_token_id": 256000,
|
| 47 |
"boi_token_id": 255999,
|
| 48 |
+
"do_sample": true,
|
| 49 |
"dtype": "bfloat16",
|
| 50 |
"eoa_token_id": 258883,
|
| 51 |
"eoa_token_index": 258883,
|
|
|
|
| 55 |
106,
|
| 56 |
50
|
| 57 |
],
|
| 58 |
+
"generation_config": {
|
| 59 |
+
"bos_token_id": 2,
|
| 60 |
+
"do_sample": true,
|
| 61 |
+
"eos_token_id": [
|
| 62 |
+
1,
|
| 63 |
+
106,
|
| 64 |
+
50
|
| 65 |
+
],
|
| 66 |
+
"pad_token_id": 0,
|
| 67 |
+
"temperature": 1.0,
|
| 68 |
+
"top_k": 64,
|
| 69 |
+
"top_p": 0.95,
|
| 70 |
+
"transformers_version": "5.5.0.dev0"
|
| 71 |
+
},
|
| 72 |
"image_token_id": 258880,
|
| 73 |
"initializer_range": 0.02,
|
| 74 |
"model_type": "gemma4",
|
|
|
|
| 82 |
"bits": 8,
|
| 83 |
"mode": "affine"
|
| 84 |
},
|
| 85 |
+
"temperature": 1.0,
|
| 86 |
"text_config": {
|
| 87 |
"attention_bias": false,
|
| 88 |
"attention_dropout": 0.0,
|
|
|
|
| 168 |
"vocab_size_per_layer_input": 262144
|
| 169 |
},
|
| 170 |
"tie_word_embeddings": true,
|
| 171 |
+
"top_k": 64,
|
| 172 |
+
"top_p": 0.95,
|
| 173 |
"transformers_version": "5.5.0.dev0",
|
| 174 |
"video_token_id": 258884,
|
| 175 |
"vision_config": {
|
model-00001-of-00002.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:0e82359bc2f0effdad15168d05a2ae3d46e72cb3296b5658303a2f78eee9926b
|
| 3 |
+
size 5365634455
|
model-00002-of-00002.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:797c7786d137de2b77826ae838ee366eab5a9479dfca91b345f71b7e99d71cfe
|
| 3 |
+
size 500946703
|
model.safetensors.index.json
CHANGED
|
@@ -1,6 +1,6 @@
|
|
| 1 |
{
|
| 2 |
"metadata": {
|
| 3 |
-
"total_size":
|
| 4 |
},
|
| 5 |
"weight_map": {
|
| 6 |
"audio_tower.layers.0.feed_forward1.ffw_layer_1.input_max": "model-00001-of-00002.safetensors",
|
|
@@ -77,34 +77,34 @@
|
|
| 77 |
"audio_tower.layers.1.feed_forward1.ffw_layer_2.output_min": "model-00001-of-00002.safetensors",
|
| 78 |
"audio_tower.layers.1.feed_forward1.post_layer_norm.weight": "model-00001-of-00002.safetensors",
|
| 79 |
"audio_tower.layers.1.feed_forward1.pre_layer_norm.weight": "model-00001-of-00002.safetensors",
|
| 80 |
-
"audio_tower.layers.1.feed_forward2.ffw_layer_1.input_max": "model-
|
| 81 |
-
"audio_tower.layers.1.feed_forward2.ffw_layer_1.input_min": "model-
|
| 82 |
-
"audio_tower.layers.1.feed_forward2.ffw_layer_1.linear.weight": "model-
|
| 83 |
-
"audio_tower.layers.1.feed_forward2.ffw_layer_1.output_max": "model-
|
| 84 |
-
"audio_tower.layers.1.feed_forward2.ffw_layer_1.output_min": "model-
|
| 85 |
-
"audio_tower.layers.1.feed_forward2.ffw_layer_2.input_max": "model-
|
| 86 |
-
"audio_tower.layers.1.feed_forward2.ffw_layer_2.input_min": "model-
|
| 87 |
-
"audio_tower.layers.1.feed_forward2.ffw_layer_2.linear.weight": "model-
|
| 88 |
-
"audio_tower.layers.1.feed_forward2.ffw_layer_2.output_max": "model-
|
| 89 |
-
"audio_tower.layers.1.feed_forward2.ffw_layer_2.output_min": "model-
|
| 90 |
-
"audio_tower.layers.1.feed_forward2.post_layer_norm.weight": "model-
|
| 91 |
-
"audio_tower.layers.1.feed_forward2.pre_layer_norm.weight": "model-
|
| 92 |
-
"audio_tower.layers.1.lconv1d.conv_norm.weight": "model-
|
| 93 |
-
"audio_tower.layers.1.lconv1d.depthwise_conv1d.weight": "model-
|
| 94 |
-
"audio_tower.layers.1.lconv1d.linear_end.input_max": "model-
|
| 95 |
-
"audio_tower.layers.1.lconv1d.linear_end.input_min": "model-
|
| 96 |
-
"audio_tower.layers.1.lconv1d.linear_end.linear.weight": "model-
|
| 97 |
-
"audio_tower.layers.1.lconv1d.linear_end.output_max": "model-
|
| 98 |
-
"audio_tower.layers.1.lconv1d.linear_end.output_min": "model-
|
| 99 |
-
"audio_tower.layers.1.lconv1d.linear_start.input_max": "model-
|
| 100 |
-
"audio_tower.layers.1.lconv1d.linear_start.input_min": "model-
|
| 101 |
-
"audio_tower.layers.1.lconv1d.linear_start.linear.weight": "model-
|
| 102 |
-
"audio_tower.layers.1.lconv1d.linear_start.output_max": "model-
|
| 103 |
-
"audio_tower.layers.1.lconv1d.linear_start.output_min": "model-
|
| 104 |
"audio_tower.layers.1.lconv1d.pre_layer_norm.weight": "model-00001-of-00002.safetensors",
|
| 105 |
-
"audio_tower.layers.1.norm_out.weight": "model-
|
| 106 |
-
"audio_tower.layers.1.norm_post_attn.weight": "model-
|
| 107 |
-
"audio_tower.layers.1.norm_pre_attn.weight": "model-
|
| 108 |
"audio_tower.layers.1.self_attn.k_proj.input_max": "model-00001-of-00002.safetensors",
|
| 109 |
"audio_tower.layers.1.self_attn.k_proj.input_min": "model-00001-of-00002.safetensors",
|
| 110 |
"audio_tower.layers.1.self_attn.k_proj.linear.weight": "model-00001-of-00002.safetensors",
|
|
@@ -251,18 +251,18 @@
|
|
| 251 |
"audio_tower.layers.11.self_attn.v_proj.linear.weight": "model-00002-of-00002.safetensors",
|
| 252 |
"audio_tower.layers.11.self_attn.v_proj.output_max": "model-00002-of-00002.safetensors",
|
| 253 |
"audio_tower.layers.11.self_attn.v_proj.output_min": "model-00002-of-00002.safetensors",
|
| 254 |
-
"audio_tower.layers.2.feed_forward1.ffw_layer_1.input_max": "model-
|
| 255 |
-
"audio_tower.layers.2.feed_forward1.ffw_layer_1.input_min": "model-
|
| 256 |
-
"audio_tower.layers.2.feed_forward1.ffw_layer_1.linear.weight": "model-
|
| 257 |
-
"audio_tower.layers.2.feed_forward1.ffw_layer_1.output_max": "model-
|
| 258 |
-
"audio_tower.layers.2.feed_forward1.ffw_layer_1.output_min": "model-
|
| 259 |
"audio_tower.layers.2.feed_forward1.ffw_layer_2.input_max": "model-00002-of-00002.safetensors",
|
| 260 |
"audio_tower.layers.2.feed_forward1.ffw_layer_2.input_min": "model-00002-of-00002.safetensors",
|
| 261 |
"audio_tower.layers.2.feed_forward1.ffw_layer_2.linear.weight": "model-00002-of-00002.safetensors",
|
| 262 |
"audio_tower.layers.2.feed_forward1.ffw_layer_2.output_max": "model-00002-of-00002.safetensors",
|
| 263 |
"audio_tower.layers.2.feed_forward1.ffw_layer_2.output_min": "model-00002-of-00002.safetensors",
|
| 264 |
"audio_tower.layers.2.feed_forward1.post_layer_norm.weight": "model-00002-of-00002.safetensors",
|
| 265 |
-
"audio_tower.layers.2.feed_forward1.pre_layer_norm.weight": "model-
|
| 266 |
"audio_tower.layers.2.feed_forward2.ffw_layer_1.input_max": "model-00002-of-00002.safetensors",
|
| 267 |
"audio_tower.layers.2.feed_forward2.ffw_layer_1.input_min": "model-00002-of-00002.safetensors",
|
| 268 |
"audio_tower.layers.2.feed_forward2.ffw_layer_1.linear.weight": "model-00002-of-00002.safetensors",
|
|
@@ -1032,10 +1032,6 @@
|
|
| 1032 |
"language_model.model.layers.15.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1033 |
"language_model.model.layers.15.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1034 |
"language_model.model.layers.15.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1035 |
-
"language_model.model.layers.15.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1036 |
-
"language_model.model.layers.15.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1037 |
-
"language_model.model.layers.15.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1038 |
-
"language_model.model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1039 |
"language_model.model.layers.15.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1040 |
"language_model.model.layers.15.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1041 |
"language_model.model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1043,9 +1039,6 @@
|
|
| 1043 |
"language_model.model.layers.15.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1044 |
"language_model.model.layers.15.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1045 |
"language_model.model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1046 |
-
"language_model.model.layers.15.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1047 |
-
"language_model.model.layers.15.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1048 |
-
"language_model.model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1049 |
"language_model.model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1050 |
"language_model.model.layers.16.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1051 |
"language_model.model.layers.16.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1067,10 +1060,6 @@
|
|
| 1067 |
"language_model.model.layers.16.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1068 |
"language_model.model.layers.16.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1069 |
"language_model.model.layers.16.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1070 |
-
"language_model.model.layers.16.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1071 |
-
"language_model.model.layers.16.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1072 |
-
"language_model.model.layers.16.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1073 |
-
"language_model.model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1074 |
"language_model.model.layers.16.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1075 |
"language_model.model.layers.16.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1076 |
"language_model.model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1078,9 +1067,6 @@
|
|
| 1078 |
"language_model.model.layers.16.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1079 |
"language_model.model.layers.16.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1080 |
"language_model.model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1081 |
-
"language_model.model.layers.16.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1082 |
-
"language_model.model.layers.16.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1083 |
-
"language_model.model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1084 |
"language_model.model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1085 |
"language_model.model.layers.17.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1086 |
"language_model.model.layers.17.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1102,10 +1088,6 @@
|
|
| 1102 |
"language_model.model.layers.17.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1103 |
"language_model.model.layers.17.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1104 |
"language_model.model.layers.17.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1105 |
-
"language_model.model.layers.17.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1106 |
-
"language_model.model.layers.17.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1107 |
-
"language_model.model.layers.17.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1108 |
-
"language_model.model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1109 |
"language_model.model.layers.17.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1110 |
"language_model.model.layers.17.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1111 |
"language_model.model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1113,9 +1095,6 @@
|
|
| 1113 |
"language_model.model.layers.17.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1114 |
"language_model.model.layers.17.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1115 |
"language_model.model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1116 |
-
"language_model.model.layers.17.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1117 |
-
"language_model.model.layers.17.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1118 |
-
"language_model.model.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1119 |
"language_model.model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1120 |
"language_model.model.layers.18.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1121 |
"language_model.model.layers.18.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1137,10 +1116,6 @@
|
|
| 1137 |
"language_model.model.layers.18.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1138 |
"language_model.model.layers.18.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1139 |
"language_model.model.layers.18.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1140 |
-
"language_model.model.layers.18.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1141 |
-
"language_model.model.layers.18.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1142 |
-
"language_model.model.layers.18.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1143 |
-
"language_model.model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1144 |
"language_model.model.layers.18.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1145 |
"language_model.model.layers.18.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1146 |
"language_model.model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1148,9 +1123,6 @@
|
|
| 1148 |
"language_model.model.layers.18.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1149 |
"language_model.model.layers.18.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1150 |
"language_model.model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1151 |
-
"language_model.model.layers.18.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1152 |
-
"language_model.model.layers.18.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1153 |
-
"language_model.model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1154 |
"language_model.model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1155 |
"language_model.model.layers.19.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1156 |
"language_model.model.layers.19.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1172,10 +1144,6 @@
|
|
| 1172 |
"language_model.model.layers.19.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1173 |
"language_model.model.layers.19.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1174 |
"language_model.model.layers.19.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1175 |
-
"language_model.model.layers.19.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1176 |
-
"language_model.model.layers.19.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1177 |
-
"language_model.model.layers.19.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1178 |
-
"language_model.model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1179 |
"language_model.model.layers.19.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1180 |
"language_model.model.layers.19.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1181 |
"language_model.model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1183,9 +1151,6 @@
|
|
| 1183 |
"language_model.model.layers.19.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1184 |
"language_model.model.layers.19.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1185 |
"language_model.model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1186 |
-
"language_model.model.layers.19.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1187 |
-
"language_model.model.layers.19.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1188 |
-
"language_model.model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1189 |
"language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1190 |
"language_model.model.layers.2.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1191 |
"language_model.model.layers.2.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1242,10 +1207,6 @@
|
|
| 1242 |
"language_model.model.layers.20.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1243 |
"language_model.model.layers.20.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1244 |
"language_model.model.layers.20.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1245 |
-
"language_model.model.layers.20.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1246 |
-
"language_model.model.layers.20.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1247 |
-
"language_model.model.layers.20.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1248 |
-
"language_model.model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1249 |
"language_model.model.layers.20.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1250 |
"language_model.model.layers.20.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1251 |
"language_model.model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1253,9 +1214,6 @@
|
|
| 1253 |
"language_model.model.layers.20.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1254 |
"language_model.model.layers.20.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1255 |
"language_model.model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1256 |
-
"language_model.model.layers.20.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1257 |
-
"language_model.model.layers.20.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1258 |
-
"language_model.model.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1259 |
"language_model.model.layers.21.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1260 |
"language_model.model.layers.21.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1261 |
"language_model.model.layers.21.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1277,10 +1235,6 @@
|
|
| 1277 |
"language_model.model.layers.21.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1278 |
"language_model.model.layers.21.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1279 |
"language_model.model.layers.21.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1280 |
-
"language_model.model.layers.21.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1281 |
-
"language_model.model.layers.21.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1282 |
-
"language_model.model.layers.21.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1283 |
-
"language_model.model.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1284 |
"language_model.model.layers.21.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1285 |
"language_model.model.layers.21.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1286 |
"language_model.model.layers.21.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1288,9 +1242,6 @@
|
|
| 1288 |
"language_model.model.layers.21.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1289 |
"language_model.model.layers.21.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1290 |
"language_model.model.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1291 |
-
"language_model.model.layers.21.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1292 |
-
"language_model.model.layers.21.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1293 |
-
"language_model.model.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1294 |
"language_model.model.layers.22.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1295 |
"language_model.model.layers.22.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1296 |
"language_model.model.layers.22.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1312,10 +1263,6 @@
|
|
| 1312 |
"language_model.model.layers.22.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1313 |
"language_model.model.layers.22.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1314 |
"language_model.model.layers.22.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1315 |
-
"language_model.model.layers.22.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1316 |
-
"language_model.model.layers.22.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1317 |
-
"language_model.model.layers.22.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1318 |
-
"language_model.model.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1319 |
"language_model.model.layers.22.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1320 |
"language_model.model.layers.22.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1321 |
"language_model.model.layers.22.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1323,9 +1270,6 @@
|
|
| 1323 |
"language_model.model.layers.22.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1324 |
"language_model.model.layers.22.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1325 |
"language_model.model.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1326 |
-
"language_model.model.layers.22.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1327 |
-
"language_model.model.layers.22.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1328 |
-
"language_model.model.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1329 |
"language_model.model.layers.23.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1330 |
"language_model.model.layers.23.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1331 |
"language_model.model.layers.23.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1347,10 +1291,6 @@
|
|
| 1347 |
"language_model.model.layers.23.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1348 |
"language_model.model.layers.23.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1349 |
"language_model.model.layers.23.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1350 |
-
"language_model.model.layers.23.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1351 |
-
"language_model.model.layers.23.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1352 |
-
"language_model.model.layers.23.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1353 |
-
"language_model.model.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1354 |
"language_model.model.layers.23.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1355 |
"language_model.model.layers.23.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1356 |
"language_model.model.layers.23.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1358,9 +1298,6 @@
|
|
| 1358 |
"language_model.model.layers.23.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1359 |
"language_model.model.layers.23.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1360 |
"language_model.model.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1361 |
-
"language_model.model.layers.23.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1362 |
-
"language_model.model.layers.23.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1363 |
-
"language_model.model.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1364 |
"language_model.model.layers.24.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1365 |
"language_model.model.layers.24.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1366 |
"language_model.model.layers.24.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1382,10 +1319,6 @@
|
|
| 1382 |
"language_model.model.layers.24.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1383 |
"language_model.model.layers.24.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1384 |
"language_model.model.layers.24.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1385 |
-
"language_model.model.layers.24.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1386 |
-
"language_model.model.layers.24.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1387 |
-
"language_model.model.layers.24.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1388 |
-
"language_model.model.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1389 |
"language_model.model.layers.24.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1390 |
"language_model.model.layers.24.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1391 |
"language_model.model.layers.24.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1393,9 +1326,6 @@
|
|
| 1393 |
"language_model.model.layers.24.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1394 |
"language_model.model.layers.24.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1395 |
"language_model.model.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1396 |
-
"language_model.model.layers.24.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1397 |
-
"language_model.model.layers.24.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1398 |
-
"language_model.model.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1399 |
"language_model.model.layers.25.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1400 |
"language_model.model.layers.25.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1401 |
"language_model.model.layers.25.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1417,10 +1347,6 @@
|
|
| 1417 |
"language_model.model.layers.25.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1418 |
"language_model.model.layers.25.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1419 |
"language_model.model.layers.25.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1420 |
-
"language_model.model.layers.25.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1421 |
-
"language_model.model.layers.25.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1422 |
-
"language_model.model.layers.25.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1423 |
-
"language_model.model.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1424 |
"language_model.model.layers.25.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1425 |
"language_model.model.layers.25.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1426 |
"language_model.model.layers.25.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1428,9 +1354,6 @@
|
|
| 1428 |
"language_model.model.layers.25.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1429 |
"language_model.model.layers.25.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1430 |
"language_model.model.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1431 |
-
"language_model.model.layers.25.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1432 |
-
"language_model.model.layers.25.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1433 |
-
"language_model.model.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1434 |
"language_model.model.layers.26.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1435 |
"language_model.model.layers.26.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1436 |
"language_model.model.layers.26.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1452,10 +1375,6 @@
|
|
| 1452 |
"language_model.model.layers.26.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1453 |
"language_model.model.layers.26.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1454 |
"language_model.model.layers.26.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1455 |
-
"language_model.model.layers.26.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1456 |
-
"language_model.model.layers.26.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1457 |
-
"language_model.model.layers.26.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1458 |
-
"language_model.model.layers.26.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1459 |
"language_model.model.layers.26.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1460 |
"language_model.model.layers.26.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1461 |
"language_model.model.layers.26.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1463,9 +1382,6 @@
|
|
| 1463 |
"language_model.model.layers.26.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1464 |
"language_model.model.layers.26.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1465 |
"language_model.model.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1466 |
-
"language_model.model.layers.26.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1467 |
-
"language_model.model.layers.26.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1468 |
-
"language_model.model.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1469 |
"language_model.model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1470 |
"language_model.model.layers.27.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1471 |
"language_model.model.layers.27.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1487,10 +1403,6 @@
|
|
| 1487 |
"language_model.model.layers.27.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1488 |
"language_model.model.layers.27.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1489 |
"language_model.model.layers.27.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1490 |
-
"language_model.model.layers.27.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1491 |
-
"language_model.model.layers.27.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1492 |
-
"language_model.model.layers.27.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1493 |
-
"language_model.model.layers.27.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1494 |
"language_model.model.layers.27.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1495 |
"language_model.model.layers.27.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1496 |
"language_model.model.layers.27.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1498,9 +1410,6 @@
|
|
| 1498 |
"language_model.model.layers.27.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1499 |
"language_model.model.layers.27.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1500 |
"language_model.model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1501 |
-
"language_model.model.layers.27.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1502 |
-
"language_model.model.layers.27.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1503 |
-
"language_model.model.layers.27.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1504 |
"language_model.model.layers.28.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1505 |
"language_model.model.layers.28.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1506 |
"language_model.model.layers.28.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1522,10 +1431,6 @@
|
|
| 1522 |
"language_model.model.layers.28.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1523 |
"language_model.model.layers.28.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1524 |
"language_model.model.layers.28.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1525 |
-
"language_model.model.layers.28.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1526 |
-
"language_model.model.layers.28.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1527 |
-
"language_model.model.layers.28.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1528 |
-
"language_model.model.layers.28.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1529 |
"language_model.model.layers.28.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1530 |
"language_model.model.layers.28.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1531 |
"language_model.model.layers.28.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1533,9 +1438,6 @@
|
|
| 1533 |
"language_model.model.layers.28.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1534 |
"language_model.model.layers.28.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1535 |
"language_model.model.layers.28.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1536 |
-
"language_model.model.layers.28.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1537 |
-
"language_model.model.layers.28.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1538 |
-
"language_model.model.layers.28.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1539 |
"language_model.model.layers.29.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1540 |
"language_model.model.layers.29.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1541 |
"language_model.model.layers.29.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1557,10 +1459,6 @@
|
|
| 1557 |
"language_model.model.layers.29.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1558 |
"language_model.model.layers.29.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1559 |
"language_model.model.layers.29.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1560 |
-
"language_model.model.layers.29.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1561 |
-
"language_model.model.layers.29.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1562 |
-
"language_model.model.layers.29.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1563 |
-
"language_model.model.layers.29.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1564 |
"language_model.model.layers.29.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1565 |
"language_model.model.layers.29.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1566 |
"language_model.model.layers.29.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1568,9 +1466,6 @@
|
|
| 1568 |
"language_model.model.layers.29.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1569 |
"language_model.model.layers.29.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1570 |
"language_model.model.layers.29.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1571 |
-
"language_model.model.layers.29.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1572 |
-
"language_model.model.layers.29.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1573 |
-
"language_model.model.layers.29.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1574 |
"language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1575 |
"language_model.model.layers.3.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1576 |
"language_model.model.layers.3.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1627,10 +1522,6 @@
|
|
| 1627 |
"language_model.model.layers.30.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1628 |
"language_model.model.layers.30.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1629 |
"language_model.model.layers.30.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1630 |
-
"language_model.model.layers.30.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1631 |
-
"language_model.model.layers.30.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1632 |
-
"language_model.model.layers.30.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1633 |
-
"language_model.model.layers.30.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1634 |
"language_model.model.layers.30.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1635 |
"language_model.model.layers.30.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1636 |
"language_model.model.layers.30.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1638,9 +1529,6 @@
|
|
| 1638 |
"language_model.model.layers.30.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1639 |
"language_model.model.layers.30.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1640 |
"language_model.model.layers.30.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1641 |
-
"language_model.model.layers.30.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1642 |
-
"language_model.model.layers.30.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1643 |
-
"language_model.model.layers.30.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1644 |
"language_model.model.layers.31.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1645 |
"language_model.model.layers.31.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1646 |
"language_model.model.layers.31.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1662,10 +1550,6 @@
|
|
| 1662 |
"language_model.model.layers.31.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1663 |
"language_model.model.layers.31.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1664 |
"language_model.model.layers.31.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1665 |
-
"language_model.model.layers.31.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1666 |
-
"language_model.model.layers.31.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1667 |
-
"language_model.model.layers.31.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1668 |
-
"language_model.model.layers.31.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1669 |
"language_model.model.layers.31.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1670 |
"language_model.model.layers.31.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1671 |
"language_model.model.layers.31.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1673,9 +1557,6 @@
|
|
| 1673 |
"language_model.model.layers.31.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1674 |
"language_model.model.layers.31.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1675 |
"language_model.model.layers.31.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1676 |
-
"language_model.model.layers.31.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1677 |
-
"language_model.model.layers.31.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1678 |
-
"language_model.model.layers.31.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1679 |
"language_model.model.layers.32.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1680 |
"language_model.model.layers.32.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1681 |
"language_model.model.layers.32.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1697,10 +1578,6 @@
|
|
| 1697 |
"language_model.model.layers.32.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1698 |
"language_model.model.layers.32.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1699 |
"language_model.model.layers.32.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1700 |
-
"language_model.model.layers.32.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1701 |
-
"language_model.model.layers.32.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1702 |
-
"language_model.model.layers.32.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1703 |
-
"language_model.model.layers.32.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1704 |
"language_model.model.layers.32.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1705 |
"language_model.model.layers.32.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1706 |
"language_model.model.layers.32.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1708,9 +1585,6 @@
|
|
| 1708 |
"language_model.model.layers.32.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1709 |
"language_model.model.layers.32.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1710 |
"language_model.model.layers.32.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1711 |
-
"language_model.model.layers.32.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1712 |
-
"language_model.model.layers.32.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1713 |
-
"language_model.model.layers.32.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1714 |
"language_model.model.layers.33.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1715 |
"language_model.model.layers.33.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1716 |
"language_model.model.layers.33.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1732,10 +1606,6 @@
|
|
| 1732 |
"language_model.model.layers.33.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1733 |
"language_model.model.layers.33.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1734 |
"language_model.model.layers.33.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1735 |
-
"language_model.model.layers.33.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1736 |
-
"language_model.model.layers.33.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1737 |
-
"language_model.model.layers.33.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1738 |
-
"language_model.model.layers.33.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1739 |
"language_model.model.layers.33.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1740 |
"language_model.model.layers.33.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1741 |
"language_model.model.layers.33.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1743,9 +1613,6 @@
|
|
| 1743 |
"language_model.model.layers.33.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1744 |
"language_model.model.layers.33.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1745 |
"language_model.model.layers.33.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1746 |
-
"language_model.model.layers.33.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1747 |
-
"language_model.model.layers.33.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1748 |
-
"language_model.model.layers.33.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1749 |
"language_model.model.layers.34.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1750 |
"language_model.model.layers.34.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1751 |
"language_model.model.layers.34.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1767,10 +1634,6 @@
|
|
| 1767 |
"language_model.model.layers.34.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1768 |
"language_model.model.layers.34.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1769 |
"language_model.model.layers.34.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1770 |
-
"language_model.model.layers.34.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1771 |
-
"language_model.model.layers.34.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1772 |
-
"language_model.model.layers.34.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1773 |
-
"language_model.model.layers.34.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1774 |
"language_model.model.layers.34.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1775 |
"language_model.model.layers.34.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1776 |
"language_model.model.layers.34.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1778,9 +1641,6 @@
|
|
| 1778 |
"language_model.model.layers.34.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1779 |
"language_model.model.layers.34.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1780 |
"language_model.model.layers.34.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1781 |
-
"language_model.model.layers.34.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1782 |
-
"language_model.model.layers.34.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1783 |
-
"language_model.model.layers.34.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1784 |
"language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1785 |
"language_model.model.layers.4.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1786 |
"language_model.model.layers.4.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1992,6 +1852,8 @@
|
|
| 1992 |
"language_model.model.layers.9.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1993 |
"language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1994 |
"language_model.model.norm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
| 1995 |
"language_model.model.per_layer_model_projection.weight": "model-00001-of-00002.safetensors",
|
| 1996 |
"language_model.model.per_layer_projection_norm.weight": "model-00001-of-00002.safetensors",
|
| 1997 |
"vision_tower.encoder.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1 |
{
|
| 2 |
"metadata": {
|
| 3 |
+
"total_size": 5866263494
|
| 4 |
},
|
| 5 |
"weight_map": {
|
| 6 |
"audio_tower.layers.0.feed_forward1.ffw_layer_1.input_max": "model-00001-of-00002.safetensors",
|
|
|
|
| 77 |
"audio_tower.layers.1.feed_forward1.ffw_layer_2.output_min": "model-00001-of-00002.safetensors",
|
| 78 |
"audio_tower.layers.1.feed_forward1.post_layer_norm.weight": "model-00001-of-00002.safetensors",
|
| 79 |
"audio_tower.layers.1.feed_forward1.pre_layer_norm.weight": "model-00001-of-00002.safetensors",
|
| 80 |
+
"audio_tower.layers.1.feed_forward2.ffw_layer_1.input_max": "model-00001-of-00002.safetensors",
|
| 81 |
+
"audio_tower.layers.1.feed_forward2.ffw_layer_1.input_min": "model-00001-of-00002.safetensors",
|
| 82 |
+
"audio_tower.layers.1.feed_forward2.ffw_layer_1.linear.weight": "model-00001-of-00002.safetensors",
|
| 83 |
+
"audio_tower.layers.1.feed_forward2.ffw_layer_1.output_max": "model-00001-of-00002.safetensors",
|
| 84 |
+
"audio_tower.layers.1.feed_forward2.ffw_layer_1.output_min": "model-00001-of-00002.safetensors",
|
| 85 |
+
"audio_tower.layers.1.feed_forward2.ffw_layer_2.input_max": "model-00001-of-00002.safetensors",
|
| 86 |
+
"audio_tower.layers.1.feed_forward2.ffw_layer_2.input_min": "model-00001-of-00002.safetensors",
|
| 87 |
+
"audio_tower.layers.1.feed_forward2.ffw_layer_2.linear.weight": "model-00001-of-00002.safetensors",
|
| 88 |
+
"audio_tower.layers.1.feed_forward2.ffw_layer_2.output_max": "model-00001-of-00002.safetensors",
|
| 89 |
+
"audio_tower.layers.1.feed_forward2.ffw_layer_2.output_min": "model-00001-of-00002.safetensors",
|
| 90 |
+
"audio_tower.layers.1.feed_forward2.post_layer_norm.weight": "model-00001-of-00002.safetensors",
|
| 91 |
+
"audio_tower.layers.1.feed_forward2.pre_layer_norm.weight": "model-00001-of-00002.safetensors",
|
| 92 |
+
"audio_tower.layers.1.lconv1d.conv_norm.weight": "model-00001-of-00002.safetensors",
|
| 93 |
+
"audio_tower.layers.1.lconv1d.depthwise_conv1d.weight": "model-00001-of-00002.safetensors",
|
| 94 |
+
"audio_tower.layers.1.lconv1d.linear_end.input_max": "model-00001-of-00002.safetensors",
|
| 95 |
+
"audio_tower.layers.1.lconv1d.linear_end.input_min": "model-00001-of-00002.safetensors",
|
| 96 |
+
"audio_tower.layers.1.lconv1d.linear_end.linear.weight": "model-00001-of-00002.safetensors",
|
| 97 |
+
"audio_tower.layers.1.lconv1d.linear_end.output_max": "model-00001-of-00002.safetensors",
|
| 98 |
+
"audio_tower.layers.1.lconv1d.linear_end.output_min": "model-00001-of-00002.safetensors",
|
| 99 |
+
"audio_tower.layers.1.lconv1d.linear_start.input_max": "model-00001-of-00002.safetensors",
|
| 100 |
+
"audio_tower.layers.1.lconv1d.linear_start.input_min": "model-00001-of-00002.safetensors",
|
| 101 |
+
"audio_tower.layers.1.lconv1d.linear_start.linear.weight": "model-00001-of-00002.safetensors",
|
| 102 |
+
"audio_tower.layers.1.lconv1d.linear_start.output_max": "model-00001-of-00002.safetensors",
|
| 103 |
+
"audio_tower.layers.1.lconv1d.linear_start.output_min": "model-00001-of-00002.safetensors",
|
| 104 |
"audio_tower.layers.1.lconv1d.pre_layer_norm.weight": "model-00001-of-00002.safetensors",
|
| 105 |
+
"audio_tower.layers.1.norm_out.weight": "model-00001-of-00002.safetensors",
|
| 106 |
+
"audio_tower.layers.1.norm_post_attn.weight": "model-00001-of-00002.safetensors",
|
| 107 |
+
"audio_tower.layers.1.norm_pre_attn.weight": "model-00001-of-00002.safetensors",
|
| 108 |
"audio_tower.layers.1.self_attn.k_proj.input_max": "model-00001-of-00002.safetensors",
|
| 109 |
"audio_tower.layers.1.self_attn.k_proj.input_min": "model-00001-of-00002.safetensors",
|
| 110 |
"audio_tower.layers.1.self_attn.k_proj.linear.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 251 |
"audio_tower.layers.11.self_attn.v_proj.linear.weight": "model-00002-of-00002.safetensors",
|
| 252 |
"audio_tower.layers.11.self_attn.v_proj.output_max": "model-00002-of-00002.safetensors",
|
| 253 |
"audio_tower.layers.11.self_attn.v_proj.output_min": "model-00002-of-00002.safetensors",
|
| 254 |
+
"audio_tower.layers.2.feed_forward1.ffw_layer_1.input_max": "model-00001-of-00002.safetensors",
|
| 255 |
+
"audio_tower.layers.2.feed_forward1.ffw_layer_1.input_min": "model-00001-of-00002.safetensors",
|
| 256 |
+
"audio_tower.layers.2.feed_forward1.ffw_layer_1.linear.weight": "model-00001-of-00002.safetensors",
|
| 257 |
+
"audio_tower.layers.2.feed_forward1.ffw_layer_1.output_max": "model-00001-of-00002.safetensors",
|
| 258 |
+
"audio_tower.layers.2.feed_forward1.ffw_layer_1.output_min": "model-00001-of-00002.safetensors",
|
| 259 |
"audio_tower.layers.2.feed_forward1.ffw_layer_2.input_max": "model-00002-of-00002.safetensors",
|
| 260 |
"audio_tower.layers.2.feed_forward1.ffw_layer_2.input_min": "model-00002-of-00002.safetensors",
|
| 261 |
"audio_tower.layers.2.feed_forward1.ffw_layer_2.linear.weight": "model-00002-of-00002.safetensors",
|
| 262 |
"audio_tower.layers.2.feed_forward1.ffw_layer_2.output_max": "model-00002-of-00002.safetensors",
|
| 263 |
"audio_tower.layers.2.feed_forward1.ffw_layer_2.output_min": "model-00002-of-00002.safetensors",
|
| 264 |
"audio_tower.layers.2.feed_forward1.post_layer_norm.weight": "model-00002-of-00002.safetensors",
|
| 265 |
+
"audio_tower.layers.2.feed_forward1.pre_layer_norm.weight": "model-00001-of-00002.safetensors",
|
| 266 |
"audio_tower.layers.2.feed_forward2.ffw_layer_1.input_max": "model-00002-of-00002.safetensors",
|
| 267 |
"audio_tower.layers.2.feed_forward2.ffw_layer_1.input_min": "model-00002-of-00002.safetensors",
|
| 268 |
"audio_tower.layers.2.feed_forward2.ffw_layer_1.linear.weight": "model-00002-of-00002.safetensors",
|
|
|
|
| 1032 |
"language_model.model.layers.15.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1033 |
"language_model.model.layers.15.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1034 |
"language_model.model.layers.15.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1035 |
"language_model.model.layers.15.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1036 |
"language_model.model.layers.15.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1037 |
"language_model.model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1039 |
"language_model.model.layers.15.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1040 |
"language_model.model.layers.15.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1041 |
"language_model.model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1042 |
"language_model.model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1043 |
"language_model.model.layers.16.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1044 |
"language_model.model.layers.16.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1060 |
"language_model.model.layers.16.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1061 |
"language_model.model.layers.16.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1062 |
"language_model.model.layers.16.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1063 |
"language_model.model.layers.16.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1064 |
"language_model.model.layers.16.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1065 |
"language_model.model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1067 |
"language_model.model.layers.16.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1068 |
"language_model.model.layers.16.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1069 |
"language_model.model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1070 |
"language_model.model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1071 |
"language_model.model.layers.17.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1072 |
"language_model.model.layers.17.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1088 |
"language_model.model.layers.17.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1089 |
"language_model.model.layers.17.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1090 |
"language_model.model.layers.17.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1091 |
"language_model.model.layers.17.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1092 |
"language_model.model.layers.17.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1093 |
"language_model.model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1095 |
"language_model.model.layers.17.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1096 |
"language_model.model.layers.17.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1097 |
"language_model.model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1098 |
"language_model.model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1099 |
"language_model.model.layers.18.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1100 |
"language_model.model.layers.18.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1116 |
"language_model.model.layers.18.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1117 |
"language_model.model.layers.18.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1118 |
"language_model.model.layers.18.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1119 |
"language_model.model.layers.18.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1120 |
"language_model.model.layers.18.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1121 |
"language_model.model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1123 |
"language_model.model.layers.18.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1124 |
"language_model.model.layers.18.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1125 |
"language_model.model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1126 |
"language_model.model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1127 |
"language_model.model.layers.19.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1128 |
"language_model.model.layers.19.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1144 |
"language_model.model.layers.19.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1145 |
"language_model.model.layers.19.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1146 |
"language_model.model.layers.19.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1147 |
"language_model.model.layers.19.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1148 |
"language_model.model.layers.19.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1149 |
"language_model.model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1151 |
"language_model.model.layers.19.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1152 |
"language_model.model.layers.19.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1153 |
"language_model.model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1154 |
"language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1155 |
"language_model.model.layers.2.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1156 |
"language_model.model.layers.2.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1207 |
"language_model.model.layers.20.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1208 |
"language_model.model.layers.20.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1209 |
"language_model.model.layers.20.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1210 |
"language_model.model.layers.20.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1211 |
"language_model.model.layers.20.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1212 |
"language_model.model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1214 |
"language_model.model.layers.20.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1215 |
"language_model.model.layers.20.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1216 |
"language_model.model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1217 |
"language_model.model.layers.21.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1218 |
"language_model.model.layers.21.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1219 |
"language_model.model.layers.21.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1235 |
"language_model.model.layers.21.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1236 |
"language_model.model.layers.21.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1237 |
"language_model.model.layers.21.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1238 |
"language_model.model.layers.21.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1239 |
"language_model.model.layers.21.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1240 |
"language_model.model.layers.21.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1242 |
"language_model.model.layers.21.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1243 |
"language_model.model.layers.21.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1244 |
"language_model.model.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1245 |
"language_model.model.layers.22.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1246 |
"language_model.model.layers.22.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1247 |
"language_model.model.layers.22.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1263 |
"language_model.model.layers.22.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1264 |
"language_model.model.layers.22.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1265 |
"language_model.model.layers.22.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1266 |
"language_model.model.layers.22.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1267 |
"language_model.model.layers.22.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1268 |
"language_model.model.layers.22.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1270 |
"language_model.model.layers.22.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1271 |
"language_model.model.layers.22.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1272 |
"language_model.model.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1273 |
"language_model.model.layers.23.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1274 |
"language_model.model.layers.23.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1275 |
"language_model.model.layers.23.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1291 |
"language_model.model.layers.23.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1292 |
"language_model.model.layers.23.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1293 |
"language_model.model.layers.23.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1294 |
"language_model.model.layers.23.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1295 |
"language_model.model.layers.23.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1296 |
"language_model.model.layers.23.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1298 |
"language_model.model.layers.23.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1299 |
"language_model.model.layers.23.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1300 |
"language_model.model.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1301 |
"language_model.model.layers.24.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1302 |
"language_model.model.layers.24.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1303 |
"language_model.model.layers.24.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1319 |
"language_model.model.layers.24.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1320 |
"language_model.model.layers.24.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1321 |
"language_model.model.layers.24.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1322 |
"language_model.model.layers.24.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1323 |
"language_model.model.layers.24.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1324 |
"language_model.model.layers.24.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1326 |
"language_model.model.layers.24.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1327 |
"language_model.model.layers.24.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1328 |
"language_model.model.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1329 |
"language_model.model.layers.25.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1330 |
"language_model.model.layers.25.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1331 |
"language_model.model.layers.25.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1347 |
"language_model.model.layers.25.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1348 |
"language_model.model.layers.25.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1349 |
"language_model.model.layers.25.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1350 |
"language_model.model.layers.25.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1351 |
"language_model.model.layers.25.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1352 |
"language_model.model.layers.25.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1354 |
"language_model.model.layers.25.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1355 |
"language_model.model.layers.25.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1356 |
"language_model.model.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1357 |
"language_model.model.layers.26.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1358 |
"language_model.model.layers.26.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1359 |
"language_model.model.layers.26.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1375 |
"language_model.model.layers.26.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1376 |
"language_model.model.layers.26.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1377 |
"language_model.model.layers.26.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1378 |
"language_model.model.layers.26.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1379 |
"language_model.model.layers.26.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1380 |
"language_model.model.layers.26.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1382 |
"language_model.model.layers.26.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1383 |
"language_model.model.layers.26.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1384 |
"language_model.model.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1385 |
"language_model.model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1386 |
"language_model.model.layers.27.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1387 |
"language_model.model.layers.27.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1403 |
"language_model.model.layers.27.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1404 |
"language_model.model.layers.27.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1405 |
"language_model.model.layers.27.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1406 |
"language_model.model.layers.27.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1407 |
"language_model.model.layers.27.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1408 |
"language_model.model.layers.27.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1410 |
"language_model.model.layers.27.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1411 |
"language_model.model.layers.27.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1412 |
"language_model.model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1413 |
"language_model.model.layers.28.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1414 |
"language_model.model.layers.28.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1415 |
"language_model.model.layers.28.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1431 |
"language_model.model.layers.28.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1432 |
"language_model.model.layers.28.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1433 |
"language_model.model.layers.28.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1434 |
"language_model.model.layers.28.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1435 |
"language_model.model.layers.28.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1436 |
"language_model.model.layers.28.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1438 |
"language_model.model.layers.28.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1439 |
"language_model.model.layers.28.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1440 |
"language_model.model.layers.28.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1441 |
"language_model.model.layers.29.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1442 |
"language_model.model.layers.29.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1443 |
"language_model.model.layers.29.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1459 |
"language_model.model.layers.29.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1460 |
"language_model.model.layers.29.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1461 |
"language_model.model.layers.29.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1462 |
"language_model.model.layers.29.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1463 |
"language_model.model.layers.29.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1464 |
"language_model.model.layers.29.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1466 |
"language_model.model.layers.29.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1467 |
"language_model.model.layers.29.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1468 |
"language_model.model.layers.29.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1469 |
"language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1470 |
"language_model.model.layers.3.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1471 |
"language_model.model.layers.3.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1522 |
"language_model.model.layers.30.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1523 |
"language_model.model.layers.30.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1524 |
"language_model.model.layers.30.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1525 |
"language_model.model.layers.30.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1526 |
"language_model.model.layers.30.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1527 |
"language_model.model.layers.30.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1529 |
"language_model.model.layers.30.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1530 |
"language_model.model.layers.30.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1531 |
"language_model.model.layers.30.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1532 |
"language_model.model.layers.31.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1533 |
"language_model.model.layers.31.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1534 |
"language_model.model.layers.31.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1550 |
"language_model.model.layers.31.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1551 |
"language_model.model.layers.31.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1552 |
"language_model.model.layers.31.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1553 |
"language_model.model.layers.31.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1554 |
"language_model.model.layers.31.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1555 |
"language_model.model.layers.31.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1557 |
"language_model.model.layers.31.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1558 |
"language_model.model.layers.31.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1559 |
"language_model.model.layers.31.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1560 |
"language_model.model.layers.32.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1561 |
"language_model.model.layers.32.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1562 |
"language_model.model.layers.32.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1578 |
"language_model.model.layers.32.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1579 |
"language_model.model.layers.32.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1580 |
"language_model.model.layers.32.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1581 |
"language_model.model.layers.32.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1582 |
"language_model.model.layers.32.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1583 |
"language_model.model.layers.32.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1585 |
"language_model.model.layers.32.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1586 |
"language_model.model.layers.32.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1587 |
"language_model.model.layers.32.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1588 |
"language_model.model.layers.33.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1589 |
"language_model.model.layers.33.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1590 |
"language_model.model.layers.33.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1606 |
"language_model.model.layers.33.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1607 |
"language_model.model.layers.33.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1608 |
"language_model.model.layers.33.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1609 |
"language_model.model.layers.33.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1610 |
"language_model.model.layers.33.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1611 |
"language_model.model.layers.33.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1613 |
"language_model.model.layers.33.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1614 |
"language_model.model.layers.33.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1615 |
"language_model.model.layers.33.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1616 |
"language_model.model.layers.34.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1617 |
"language_model.model.layers.34.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1618 |
"language_model.model.layers.34.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1634 |
"language_model.model.layers.34.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1635 |
"language_model.model.layers.34.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1636 |
"language_model.model.layers.34.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1637 |
"language_model.model.layers.34.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1638 |
"language_model.model.layers.34.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1639 |
"language_model.model.layers.34.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1641 |
"language_model.model.layers.34.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1642 |
"language_model.model.layers.34.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1643 |
"language_model.model.layers.34.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1644 |
"language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1645 |
"language_model.model.layers.4.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1646 |
"language_model.model.layers.4.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1852 |
"language_model.model.layers.9.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1853 |
"language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1854 |
"language_model.model.norm.weight": "model-00001-of-00002.safetensors",
|
| 1855 |
+
"language_model.model.per_layer_model_projection.biases": "model-00001-of-00002.safetensors",
|
| 1856 |
+
"language_model.model.per_layer_model_projection.scales": "model-00001-of-00002.safetensors",
|
| 1857 |
"language_model.model.per_layer_model_projection.weight": "model-00001-of-00002.safetensors",
|
| 1858 |
"language_model.model.per_layer_projection_norm.weight": "model-00001-of-00002.safetensors",
|
| 1859 |
"vision_tower.encoder.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
processor_config.json
CHANGED
|
@@ -29,6 +29,27 @@
|
|
| 29 |
},
|
| 30 |
"image_seq_length": 280,
|
| 31 |
"processor_class": "Gemma4Processor",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 32 |
"feature_extractor": {
|
| 33 |
"feature_extractor_type": "Gemma4AudioFeatureExtractor",
|
| 34 |
"sampling_rate": 16000,
|
|
|
|
| 29 |
},
|
| 30 |
"image_seq_length": 280,
|
| 31 |
"processor_class": "Gemma4Processor",
|
| 32 |
+
"video_processor": {
|
| 33 |
+
"default_fps": 2.0,
|
| 34 |
+
"do_normalize": true,
|
| 35 |
+
"do_rescale": true,
|
| 36 |
+
"image_mean": [
|
| 37 |
+
0.0,
|
| 38 |
+
0.0,
|
| 39 |
+
0.0
|
| 40 |
+
],
|
| 41 |
+
"image_std": [
|
| 42 |
+
1.0,
|
| 43 |
+
1.0,
|
| 44 |
+
1.0
|
| 45 |
+
],
|
| 46 |
+
"max_soft_tokens": 70,
|
| 47 |
+
"num_frames": 32,
|
| 48 |
+
"patch_size": 16,
|
| 49 |
+
"pooling_kernel_size": 3,
|
| 50 |
+
"rescale_factor": 0.00392156862745098,
|
| 51 |
+
"video_processor_type": "Gemma4VideoProcessor"
|
| 52 |
+
},
|
| 53 |
"feature_extractor": {
|
| 54 |
"feature_extractor_type": "Gemma4AudioFeatureExtractor",
|
| 55 |
"sampling_rate": 16000,
|
tokenizer_config.json
CHANGED
|
@@ -17,50 +17,72 @@
|
|
| 17 |
"<|video|>"
|
| 18 |
],
|
| 19 |
"image_token": "<|image|>",
|
|
|
|
|
|
|
| 20 |
"mask_token": "<mask>",
|
| 21 |
"model_max_length": 1000000000000000019884624838656,
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 22 |
"pad_token": "<pad>",
|
| 23 |
"padding_side": "left",
|
| 24 |
"processor_class": "Gemma4Processor",
|
| 25 |
"response_schema": {
|
| 26 |
-
"type": "object",
|
| 27 |
"properties": {
|
|
|
|
|
|
|
|
|
|
| 28 |
"role": {
|
| 29 |
"const": "assistant"
|
| 30 |
},
|
| 31 |
"thinking": {
|
| 32 |
"type": "string"
|
| 33 |
},
|
| 34 |
-
"content": {
|
| 35 |
-
"type": "string"
|
| 36 |
-
},
|
| 37 |
"tool_calls": {
|
| 38 |
-
"x-regex-iterator": "<\\|tool_call>(.*?)<tool_call\\|>",
|
| 39 |
-
"type": "array",
|
| 40 |
"items": {
|
| 41 |
-
"type": "object",
|
| 42 |
"properties": {
|
| 43 |
-
"type": {
|
| 44 |
-
"const": "function"
|
| 45 |
-
},
|
| 46 |
"function": {
|
| 47 |
-
"type": "object",
|
| 48 |
-
"x-regex": "call\\:(?P<name>\\w+)(?P<arguments>\\{.*\\})",
|
| 49 |
"properties": {
|
| 50 |
-
"name": {
|
| 51 |
-
"type": "string"
|
| 52 |
-
},
|
| 53 |
"arguments": {
|
|
|
|
| 54 |
"type": "object",
|
| 55 |
-
"x-parser": "gemma4-tool-call"
|
| 56 |
-
|
|
|
|
|
|
|
| 57 |
}
|
| 58 |
-
}
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 59 |
}
|
| 60 |
-
}
|
| 61 |
-
|
|
|
|
|
|
|
|
|
|
| 62 |
}
|
| 63 |
},
|
|
|
|
| 64 |
"x-regex": "(\\<\\|channel\\>thought\\n(?P<thinking>.*?)\\<channel\\|\\>)?(?P<tool_calls>\\<\\|tool_call\\>.*\\<tool_call\\|\\>)?(?P<content>(?:(?!\\<turn\\|\\>)(?!\\<\\|tool_response\\>).)+)?(?:\\<turn\\|\\>|\\<\\|tool_response\\>)?"
|
| 65 |
},
|
| 66 |
"soc_token": "<|channel>",
|
|
|
|
| 17 |
"<|video|>"
|
| 18 |
],
|
| 19 |
"image_token": "<|image|>",
|
| 20 |
+
"is_local": true,
|
| 21 |
+
"local_files_only": true,
|
| 22 |
"mask_token": "<mask>",
|
| 23 |
"model_max_length": 1000000000000000019884624838656,
|
| 24 |
+
"model_specific_special_tokens": {
|
| 25 |
+
"audio_token": "<|audio|>",
|
| 26 |
+
"boa_token": "<|audio>",
|
| 27 |
+
"boi_token": "<|image>",
|
| 28 |
+
"eoa_token": "<audio|>",
|
| 29 |
+
"eoc_token": "<channel|>",
|
| 30 |
+
"eoi_token": "<image|>",
|
| 31 |
+
"eot_token": "<turn|>",
|
| 32 |
+
"escape_token": "<|\"|>",
|
| 33 |
+
"etc_token": "<tool_call|>",
|
| 34 |
+
"etd_token": "<tool|>",
|
| 35 |
+
"etr_token": "<tool_response|>",
|
| 36 |
+
"image_token": "<|image|>",
|
| 37 |
+
"soc_token": "<|channel>",
|
| 38 |
+
"sot_token": "<|turn>",
|
| 39 |
+
"stc_token": "<|tool_call>",
|
| 40 |
+
"std_token": "<|tool>",
|
| 41 |
+
"str_token": "<|tool_response>",
|
| 42 |
+
"think_token": "<|think|>"
|
| 43 |
+
},
|
| 44 |
"pad_token": "<pad>",
|
| 45 |
"padding_side": "left",
|
| 46 |
"processor_class": "Gemma4Processor",
|
| 47 |
"response_schema": {
|
|
|
|
| 48 |
"properties": {
|
| 49 |
+
"content": {
|
| 50 |
+
"type": "string"
|
| 51 |
+
},
|
| 52 |
"role": {
|
| 53 |
"const": "assistant"
|
| 54 |
},
|
| 55 |
"thinking": {
|
| 56 |
"type": "string"
|
| 57 |
},
|
|
|
|
|
|
|
|
|
|
| 58 |
"tool_calls": {
|
|
|
|
|
|
|
| 59 |
"items": {
|
|
|
|
| 60 |
"properties": {
|
|
|
|
|
|
|
|
|
|
| 61 |
"function": {
|
|
|
|
|
|
|
| 62 |
"properties": {
|
|
|
|
|
|
|
|
|
|
| 63 |
"arguments": {
|
| 64 |
+
"additionalProperties": {},
|
| 65 |
"type": "object",
|
| 66 |
+
"x-parser": "gemma4-tool-call"
|
| 67 |
+
},
|
| 68 |
+
"name": {
|
| 69 |
+
"type": "string"
|
| 70 |
}
|
| 71 |
+
},
|
| 72 |
+
"type": "object",
|
| 73 |
+
"x-regex": "call\\:(?P<name>\\w+)(?P<arguments>\\{.*\\})"
|
| 74 |
+
},
|
| 75 |
+
"type": {
|
| 76 |
+
"const": "function"
|
| 77 |
}
|
| 78 |
+
},
|
| 79 |
+
"type": "object"
|
| 80 |
+
},
|
| 81 |
+
"type": "array",
|
| 82 |
+
"x-regex-iterator": "<\\|tool_call>(.*?)<tool_call\\|>"
|
| 83 |
}
|
| 84 |
},
|
| 85 |
+
"type": "object",
|
| 86 |
"x-regex": "(\\<\\|channel\\>thought\\n(?P<thinking>.*?)\\<channel\\|\\>)?(?P<tool_calls>\\<\\|tool_call\\>.*\\<tool_call\\|\\>)?(?P<content>(?:(?!\\<turn\\|\\>)(?!\\<\\|tool_response\\>).)+)?(?:\\<turn\\|\\>|\\<\\|tool_response\\>)?"
|
| 87 |
},
|
| 88 |
"soc_token": "<|channel>",
|