Instructions to use mlx-community/gemma-4-e4b-it-8bit with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use mlx-community/gemma-4-e4b-it-8bit with MLX:
# Make sure mlx-vlm is installed # pip install --upgrade mlx-vlm from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template from mlx_vlm.utils import load_config # Load the model model, processor = load("mlx-community/gemma-4-e4b-it-8bit") config = load_config("mlx-community/gemma-4-e4b-it-8bit") # Prepare input image = ["http://images.cocodataset.org/val2017/000000039769.jpg"] prompt = "Describe this image." # Apply chat template formatted_prompt = apply_chat_template( processor, config, prompt, num_images=1 ) # Generate output output = generate(model, processor, formatted_prompt, image) print(output) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
- Pi
How to use mlx-community/gemma-4-e4b-it-8bit with Pi:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "mlx-community/gemma-4-e4b-it-8bit"
Configure the model in Pi
# Install Pi: npm install -g @mariozechner/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "mlx-lm": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "mlx-community/gemma-4-e4b-it-8bit" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Hermes Agent
How to use mlx-community/gemma-4-e4b-it-8bit with Hermes Agent:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "mlx-community/gemma-4-e4b-it-8bit"
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default mlx-community/gemma-4-e4b-it-8bit
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use mlx-community/gemma-4-e4b-it-8bit with OpenClaw:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "mlx-community/gemma-4-e4b-it-8bit"
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "mlx-community/gemma-4-e4b-it-8bit" \ --custom-provider-id mlx-lm \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
Re-upload MLX conversion from google/gemma-4-E4B-it@fee6332c1abaafb77f6f9624236c63aa2f1d0187
Browse files- README.md +12 -12
- config.json +18 -0
- model-00001-of-00002.safetensors +2 -2
- model-00002-of-00002.safetensors +2 -2
- model.safetensors.index.json +3 -127
- processor_config.json +21 -0
- tokenizer_config.json +42 -20
README.md
CHANGED
|
@@ -1,25 +1,25 @@
|
|
| 1 |
---
|
| 2 |
library_name: mlx
|
| 3 |
-
license:
|
| 4 |
-
|
| 5 |
-
pipeline_tag: any-to-any
|
| 6 |
-
base_model: google/gemma-4-e4b-it
|
| 7 |
tags:
|
| 8 |
- mlx
|
|
|
|
|
|
|
|
|
|
| 9 |
---
|
| 10 |
|
| 11 |
# mlx-community/gemma-4-e4b-it-8bit
|
| 12 |
|
| 13 |
-
|
| 14 |
-
using mlx-vlm version **0.4.3**.
|
| 15 |
-
Refer to the [original model card](https://huggingface.co/google/gemma-4-e4b-it) for more details on the model.
|
| 16 |
|
| 17 |
-
|
|
|
|
|
|
|
| 18 |
|
| 19 |
-
|
| 20 |
-
pip install -U mlx-vlm
|
| 21 |
-
```
|
| 22 |
|
| 23 |
```bash
|
| 24 |
-
|
|
|
|
| 25 |
```
|
|
|
|
| 1 |
---
|
| 2 |
library_name: mlx
|
| 3 |
+
license: gemma
|
| 4 |
+
base_model: google/gemma-4-E4B-it
|
|
|
|
|
|
|
| 5 |
tags:
|
| 6 |
- mlx
|
| 7 |
+
- mlx-vlm
|
| 8 |
+
- gemma4
|
| 9 |
+
- image-text-to-text
|
| 10 |
---
|
| 11 |
|
| 12 |
# mlx-community/gemma-4-e4b-it-8bit
|
| 13 |
|
| 14 |
+
MLX conversion of [google/gemma-4-E4B-it](https://huggingface.co/google/gemma-4-E4B-it) for Apple silicon.
|
|
|
|
|
|
|
| 15 |
|
| 16 |
+
- Source revision: `fee6332c1abaafb77f6f9624236c63aa2f1d0187`
|
| 17 |
+
- Variant: `8bit`
|
| 18 |
+
- Converted with `mlx_vlm.convert` from the local `mlx-vlm` checkout.
|
| 19 |
|
| 20 |
+
## Usage
|
|
|
|
|
|
|
| 21 |
|
| 22 |
```bash
|
| 23 |
+
pip install mlx-vlm
|
| 24 |
+
python -m mlx_vlm.generate --model mlx-community/gemma-4-e4b-it-8bit --prompt "Describe this image." --image path/to/image.jpg
|
| 25 |
```
|
config.json
CHANGED
|
@@ -45,6 +45,7 @@
|
|
| 45 |
"audio_token_id": 258881,
|
| 46 |
"boa_token_id": 256000,
|
| 47 |
"boi_token_id": 255999,
|
|
|
|
| 48 |
"dtype": "bfloat16",
|
| 49 |
"eoa_token_id": 258883,
|
| 50 |
"eoa_token_index": 258883,
|
|
@@ -54,6 +55,20 @@
|
|
| 54 |
106,
|
| 55 |
50
|
| 56 |
],
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 57 |
"image_token_id": 258880,
|
| 58 |
"initializer_range": 0.02,
|
| 59 |
"model_type": "gemma4",
|
|
@@ -67,6 +82,7 @@
|
|
| 67 |
"bits": 8,
|
| 68 |
"mode": "affine"
|
| 69 |
},
|
|
|
|
| 70 |
"text_config": {
|
| 71 |
"attention_bias": false,
|
| 72 |
"attention_dropout": 0.0,
|
|
@@ -159,6 +175,8 @@
|
|
| 159 |
"vocab_size_per_layer_input": 262144
|
| 160 |
},
|
| 161 |
"tie_word_embeddings": true,
|
|
|
|
|
|
|
| 162 |
"transformers_version": "5.5.0.dev0",
|
| 163 |
"video_token_id": 258884,
|
| 164 |
"vision_config": {
|
|
|
|
| 45 |
"audio_token_id": 258881,
|
| 46 |
"boa_token_id": 256000,
|
| 47 |
"boi_token_id": 255999,
|
| 48 |
+
"do_sample": true,
|
| 49 |
"dtype": "bfloat16",
|
| 50 |
"eoa_token_id": 258883,
|
| 51 |
"eoa_token_index": 258883,
|
|
|
|
| 55 |
106,
|
| 56 |
50
|
| 57 |
],
|
| 58 |
+
"generation_config": {
|
| 59 |
+
"bos_token_id": 2,
|
| 60 |
+
"do_sample": true,
|
| 61 |
+
"eos_token_id": [
|
| 62 |
+
1,
|
| 63 |
+
106,
|
| 64 |
+
50
|
| 65 |
+
],
|
| 66 |
+
"pad_token_id": 0,
|
| 67 |
+
"temperature": 1.0,
|
| 68 |
+
"top_k": 64,
|
| 69 |
+
"top_p": 0.95,
|
| 70 |
+
"transformers_version": "5.5.0.dev0"
|
| 71 |
+
},
|
| 72 |
"image_token_id": 258880,
|
| 73 |
"initializer_range": 0.02,
|
| 74 |
"model_type": "gemma4",
|
|
|
|
| 82 |
"bits": 8,
|
| 83 |
"mode": "affine"
|
| 84 |
},
|
| 85 |
+
"temperature": 1.0,
|
| 86 |
"text_config": {
|
| 87 |
"attention_bias": false,
|
| 88 |
"attention_dropout": 0.0,
|
|
|
|
| 175 |
"vocab_size_per_layer_input": 262144
|
| 176 |
},
|
| 177 |
"tie_word_embeddings": true,
|
| 178 |
+
"top_k": 64,
|
| 179 |
+
"top_p": 0.95,
|
| 180 |
"transformers_version": "5.5.0.dev0",
|
| 181 |
"video_token_id": 258884,
|
| 182 |
"vision_config": {
|
model-00001-of-00002.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b25a7c6c2733bf33e5613aef920086065c7b7d251949a060cda8a11248c40a91
|
| 3 |
+
size 4906172928
|
model-00002-of-00002.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:1dce2b4caed28833389f57d04940ec19a357f2c693dd23458a577804de024b31
|
| 3 |
+
size 3974804036
|
model.safetensors.index.json
CHANGED
|
@@ -1,6 +1,6 @@
|
|
| 1 |
{
|
| 2 |
"metadata": {
|
| 3 |
-
"total_size":
|
| 4 |
},
|
| 5 |
"weight_map": {
|
| 6 |
"audio_tower.layers.0.feed_forward1.ffw_layer_1.input_max": "model-00002-of-00002.safetensors",
|
|
@@ -1382,10 +1382,6 @@
|
|
| 1382 |
"language_model.model.layers.24.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1383 |
"language_model.model.layers.24.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1384 |
"language_model.model.layers.24.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1385 |
-
"language_model.model.layers.24.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1386 |
-
"language_model.model.layers.24.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1387 |
-
"language_model.model.layers.24.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1388 |
-
"language_model.model.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1389 |
"language_model.model.layers.24.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1390 |
"language_model.model.layers.24.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1391 |
"language_model.model.layers.24.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1393,9 +1389,6 @@
|
|
| 1393 |
"language_model.model.layers.24.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1394 |
"language_model.model.layers.24.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1395 |
"language_model.model.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1396 |
-
"language_model.model.layers.24.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1397 |
-
"language_model.model.layers.24.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1398 |
-
"language_model.model.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1399 |
"language_model.model.layers.25.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1400 |
"language_model.model.layers.25.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1401 |
"language_model.model.layers.25.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1417,10 +1410,6 @@
|
|
| 1417 |
"language_model.model.layers.25.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1418 |
"language_model.model.layers.25.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1419 |
"language_model.model.layers.25.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1420 |
-
"language_model.model.layers.25.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1421 |
-
"language_model.model.layers.25.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1422 |
-
"language_model.model.layers.25.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1423 |
-
"language_model.model.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1424 |
"language_model.model.layers.25.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1425 |
"language_model.model.layers.25.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1426 |
"language_model.model.layers.25.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1428,9 +1417,6 @@
|
|
| 1428 |
"language_model.model.layers.25.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1429 |
"language_model.model.layers.25.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1430 |
"language_model.model.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1431 |
-
"language_model.model.layers.25.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1432 |
-
"language_model.model.layers.25.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1433 |
-
"language_model.model.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1434 |
"language_model.model.layers.26.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1435 |
"language_model.model.layers.26.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1436 |
"language_model.model.layers.26.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1452,10 +1438,6 @@
|
|
| 1452 |
"language_model.model.layers.26.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1453 |
"language_model.model.layers.26.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1454 |
"language_model.model.layers.26.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1455 |
-
"language_model.model.layers.26.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1456 |
-
"language_model.model.layers.26.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1457 |
-
"language_model.model.layers.26.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1458 |
-
"language_model.model.layers.26.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1459 |
"language_model.model.layers.26.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1460 |
"language_model.model.layers.26.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1461 |
"language_model.model.layers.26.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1463,9 +1445,6 @@
|
|
| 1463 |
"language_model.model.layers.26.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1464 |
"language_model.model.layers.26.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1465 |
"language_model.model.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1466 |
-
"language_model.model.layers.26.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1467 |
-
"language_model.model.layers.26.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1468 |
-
"language_model.model.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1469 |
"language_model.model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1470 |
"language_model.model.layers.27.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1471 |
"language_model.model.layers.27.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1487,10 +1466,6 @@
|
|
| 1487 |
"language_model.model.layers.27.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1488 |
"language_model.model.layers.27.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1489 |
"language_model.model.layers.27.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1490 |
-
"language_model.model.layers.27.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1491 |
-
"language_model.model.layers.27.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1492 |
-
"language_model.model.layers.27.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1493 |
-
"language_model.model.layers.27.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1494 |
"language_model.model.layers.27.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1495 |
"language_model.model.layers.27.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1496 |
"language_model.model.layers.27.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1498,9 +1473,6 @@
|
|
| 1498 |
"language_model.model.layers.27.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1499 |
"language_model.model.layers.27.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1500 |
"language_model.model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1501 |
-
"language_model.model.layers.27.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1502 |
-
"language_model.model.layers.27.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1503 |
-
"language_model.model.layers.27.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1504 |
"language_model.model.layers.28.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1505 |
"language_model.model.layers.28.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1506 |
"language_model.model.layers.28.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1522,10 +1494,6 @@
|
|
| 1522 |
"language_model.model.layers.28.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1523 |
"language_model.model.layers.28.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1524 |
"language_model.model.layers.28.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1525 |
-
"language_model.model.layers.28.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1526 |
-
"language_model.model.layers.28.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1527 |
-
"language_model.model.layers.28.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1528 |
-
"language_model.model.layers.28.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1529 |
"language_model.model.layers.28.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1530 |
"language_model.model.layers.28.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1531 |
"language_model.model.layers.28.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1533,9 +1501,6 @@
|
|
| 1533 |
"language_model.model.layers.28.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1534 |
"language_model.model.layers.28.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1535 |
"language_model.model.layers.28.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1536 |
-
"language_model.model.layers.28.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1537 |
-
"language_model.model.layers.28.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1538 |
-
"language_model.model.layers.28.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1539 |
"language_model.model.layers.29.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1540 |
"language_model.model.layers.29.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1541 |
"language_model.model.layers.29.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1557,10 +1522,6 @@
|
|
| 1557 |
"language_model.model.layers.29.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1558 |
"language_model.model.layers.29.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1559 |
"language_model.model.layers.29.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1560 |
-
"language_model.model.layers.29.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1561 |
-
"language_model.model.layers.29.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1562 |
-
"language_model.model.layers.29.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1563 |
-
"language_model.model.layers.29.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1564 |
"language_model.model.layers.29.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1565 |
"language_model.model.layers.29.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1566 |
"language_model.model.layers.29.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1568,9 +1529,6 @@
|
|
| 1568 |
"language_model.model.layers.29.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1569 |
"language_model.model.layers.29.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1570 |
"language_model.model.layers.29.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1571 |
-
"language_model.model.layers.29.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1572 |
-
"language_model.model.layers.29.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1573 |
-
"language_model.model.layers.29.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1574 |
"language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1575 |
"language_model.model.layers.3.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1576 |
"language_model.model.layers.3.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1627,10 +1585,6 @@
|
|
| 1627 |
"language_model.model.layers.30.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1628 |
"language_model.model.layers.30.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1629 |
"language_model.model.layers.30.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1630 |
-
"language_model.model.layers.30.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1631 |
-
"language_model.model.layers.30.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1632 |
-
"language_model.model.layers.30.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1633 |
-
"language_model.model.layers.30.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1634 |
"language_model.model.layers.30.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1635 |
"language_model.model.layers.30.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1636 |
"language_model.model.layers.30.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1638,9 +1592,6 @@
|
|
| 1638 |
"language_model.model.layers.30.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1639 |
"language_model.model.layers.30.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1640 |
"language_model.model.layers.30.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1641 |
-
"language_model.model.layers.30.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1642 |
-
"language_model.model.layers.30.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1643 |
-
"language_model.model.layers.30.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1644 |
"language_model.model.layers.31.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1645 |
"language_model.model.layers.31.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1646 |
"language_model.model.layers.31.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1662,10 +1613,6 @@
|
|
| 1662 |
"language_model.model.layers.31.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1663 |
"language_model.model.layers.31.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1664 |
"language_model.model.layers.31.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1665 |
-
"language_model.model.layers.31.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1666 |
-
"language_model.model.layers.31.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1667 |
-
"language_model.model.layers.31.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1668 |
-
"language_model.model.layers.31.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1669 |
"language_model.model.layers.31.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1670 |
"language_model.model.layers.31.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1671 |
"language_model.model.layers.31.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1673,9 +1620,6 @@
|
|
| 1673 |
"language_model.model.layers.31.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1674 |
"language_model.model.layers.31.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1675 |
"language_model.model.layers.31.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1676 |
-
"language_model.model.layers.31.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1677 |
-
"language_model.model.layers.31.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1678 |
-
"language_model.model.layers.31.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1679 |
"language_model.model.layers.32.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1680 |
"language_model.model.layers.32.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1681 |
"language_model.model.layers.32.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1697,10 +1641,6 @@
|
|
| 1697 |
"language_model.model.layers.32.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1698 |
"language_model.model.layers.32.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1699 |
"language_model.model.layers.32.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1700 |
-
"language_model.model.layers.32.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1701 |
-
"language_model.model.layers.32.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1702 |
-
"language_model.model.layers.32.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1703 |
-
"language_model.model.layers.32.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1704 |
"language_model.model.layers.32.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1705 |
"language_model.model.layers.32.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1706 |
"language_model.model.layers.32.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1708,9 +1648,6 @@
|
|
| 1708 |
"language_model.model.layers.32.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1709 |
"language_model.model.layers.32.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1710 |
"language_model.model.layers.32.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1711 |
-
"language_model.model.layers.32.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1712 |
-
"language_model.model.layers.32.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1713 |
-
"language_model.model.layers.32.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1714 |
"language_model.model.layers.33.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1715 |
"language_model.model.layers.33.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1716 |
"language_model.model.layers.33.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1732,10 +1669,6 @@
|
|
| 1732 |
"language_model.model.layers.33.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1733 |
"language_model.model.layers.33.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1734 |
"language_model.model.layers.33.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1735 |
-
"language_model.model.layers.33.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1736 |
-
"language_model.model.layers.33.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1737 |
-
"language_model.model.layers.33.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1738 |
-
"language_model.model.layers.33.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1739 |
"language_model.model.layers.33.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1740 |
"language_model.model.layers.33.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1741 |
"language_model.model.layers.33.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1743,9 +1676,6 @@
|
|
| 1743 |
"language_model.model.layers.33.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1744 |
"language_model.model.layers.33.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1745 |
"language_model.model.layers.33.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1746 |
-
"language_model.model.layers.33.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1747 |
-
"language_model.model.layers.33.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1748 |
-
"language_model.model.layers.33.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1749 |
"language_model.model.layers.34.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1750 |
"language_model.model.layers.34.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1751 |
"language_model.model.layers.34.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1767,10 +1697,6 @@
|
|
| 1767 |
"language_model.model.layers.34.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1768 |
"language_model.model.layers.34.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1769 |
"language_model.model.layers.34.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1770 |
-
"language_model.model.layers.34.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1771 |
-
"language_model.model.layers.34.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1772 |
-
"language_model.model.layers.34.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1773 |
-
"language_model.model.layers.34.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1774 |
"language_model.model.layers.34.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1775 |
"language_model.model.layers.34.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1776 |
"language_model.model.layers.34.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1778,9 +1704,6 @@
|
|
| 1778 |
"language_model.model.layers.34.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1779 |
"language_model.model.layers.34.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1780 |
"language_model.model.layers.34.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1781 |
-
"language_model.model.layers.34.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1782 |
-
"language_model.model.layers.34.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1783 |
-
"language_model.model.layers.34.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1784 |
"language_model.model.layers.35.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1785 |
"language_model.model.layers.35.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1786 |
"language_model.model.layers.35.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1802,10 +1725,6 @@
|
|
| 1802 |
"language_model.model.layers.35.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1803 |
"language_model.model.layers.35.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1804 |
"language_model.model.layers.35.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1805 |
-
"language_model.model.layers.35.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1806 |
-
"language_model.model.layers.35.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1807 |
-
"language_model.model.layers.35.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1808 |
-
"language_model.model.layers.35.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1809 |
"language_model.model.layers.35.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1810 |
"language_model.model.layers.35.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1811 |
"language_model.model.layers.35.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1813,9 +1732,6 @@
|
|
| 1813 |
"language_model.model.layers.35.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1814 |
"language_model.model.layers.35.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1815 |
"language_model.model.layers.35.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1816 |
-
"language_model.model.layers.35.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1817 |
-
"language_model.model.layers.35.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1818 |
-
"language_model.model.layers.35.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1819 |
"language_model.model.layers.36.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1820 |
"language_model.model.layers.36.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1821 |
"language_model.model.layers.36.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1837,10 +1753,6 @@
|
|
| 1837 |
"language_model.model.layers.36.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1838 |
"language_model.model.layers.36.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1839 |
"language_model.model.layers.36.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1840 |
-
"language_model.model.layers.36.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1841 |
-
"language_model.model.layers.36.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1842 |
-
"language_model.model.layers.36.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1843 |
-
"language_model.model.layers.36.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1844 |
"language_model.model.layers.36.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1845 |
"language_model.model.layers.36.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1846 |
"language_model.model.layers.36.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1848,9 +1760,6 @@
|
|
| 1848 |
"language_model.model.layers.36.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1849 |
"language_model.model.layers.36.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1850 |
"language_model.model.layers.36.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1851 |
-
"language_model.model.layers.36.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1852 |
-
"language_model.model.layers.36.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1853 |
-
"language_model.model.layers.36.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1854 |
"language_model.model.layers.37.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1855 |
"language_model.model.layers.37.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1856 |
"language_model.model.layers.37.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1872,10 +1781,6 @@
|
|
| 1872 |
"language_model.model.layers.37.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1873 |
"language_model.model.layers.37.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1874 |
"language_model.model.layers.37.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1875 |
-
"language_model.model.layers.37.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1876 |
-
"language_model.model.layers.37.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1877 |
-
"language_model.model.layers.37.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1878 |
-
"language_model.model.layers.37.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1879 |
"language_model.model.layers.37.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1880 |
"language_model.model.layers.37.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1881 |
"language_model.model.layers.37.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1883,9 +1788,6 @@
|
|
| 1883 |
"language_model.model.layers.37.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1884 |
"language_model.model.layers.37.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1885 |
"language_model.model.layers.37.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1886 |
-
"language_model.model.layers.37.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1887 |
-
"language_model.model.layers.37.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1888 |
-
"language_model.model.layers.37.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1889 |
"language_model.model.layers.38.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1890 |
"language_model.model.layers.38.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1891 |
"language_model.model.layers.38.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1907,10 +1809,6 @@
|
|
| 1907 |
"language_model.model.layers.38.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1908 |
"language_model.model.layers.38.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1909 |
"language_model.model.layers.38.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1910 |
-
"language_model.model.layers.38.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1911 |
-
"language_model.model.layers.38.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1912 |
-
"language_model.model.layers.38.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1913 |
-
"language_model.model.layers.38.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1914 |
"language_model.model.layers.38.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1915 |
"language_model.model.layers.38.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1916 |
"language_model.model.layers.38.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1918,9 +1816,6 @@
|
|
| 1918 |
"language_model.model.layers.38.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1919 |
"language_model.model.layers.38.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1920 |
"language_model.model.layers.38.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1921 |
-
"language_model.model.layers.38.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1922 |
-
"language_model.model.layers.38.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1923 |
-
"language_model.model.layers.38.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1924 |
"language_model.model.layers.39.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1925 |
"language_model.model.layers.39.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1926 |
"language_model.model.layers.39.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -1942,10 +1837,6 @@
|
|
| 1942 |
"language_model.model.layers.39.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1943 |
"language_model.model.layers.39.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1944 |
"language_model.model.layers.39.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1945 |
-
"language_model.model.layers.39.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 1946 |
-
"language_model.model.layers.39.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 1947 |
-
"language_model.model.layers.39.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 1948 |
-
"language_model.model.layers.39.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 1949 |
"language_model.model.layers.39.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1950 |
"language_model.model.layers.39.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1951 |
"language_model.model.layers.39.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -1953,9 +1844,6 @@
|
|
| 1953 |
"language_model.model.layers.39.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1954 |
"language_model.model.layers.39.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1955 |
"language_model.model.layers.39.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 1956 |
-
"language_model.model.layers.39.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 1957 |
-
"language_model.model.layers.39.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 1958 |
-
"language_model.model.layers.39.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 1959 |
"language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1960 |
"language_model.model.layers.4.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1961 |
"language_model.model.layers.4.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -2012,10 +1900,6 @@
|
|
| 2012 |
"language_model.model.layers.40.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 2013 |
"language_model.model.layers.40.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 2014 |
"language_model.model.layers.40.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 2015 |
-
"language_model.model.layers.40.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 2016 |
-
"language_model.model.layers.40.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 2017 |
-
"language_model.model.layers.40.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 2018 |
-
"language_model.model.layers.40.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 2019 |
"language_model.model.layers.40.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 2020 |
"language_model.model.layers.40.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 2021 |
"language_model.model.layers.40.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -2023,9 +1907,6 @@
|
|
| 2023 |
"language_model.model.layers.40.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 2024 |
"language_model.model.layers.40.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 2025 |
"language_model.model.layers.40.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 2026 |
-
"language_model.model.layers.40.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 2027 |
-
"language_model.model.layers.40.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 2028 |
-
"language_model.model.layers.40.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 2029 |
"language_model.model.layers.41.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 2030 |
"language_model.model.layers.41.layer_scalar": "model-00001-of-00002.safetensors",
|
| 2031 |
"language_model.model.layers.41.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -2047,10 +1928,6 @@
|
|
| 2047 |
"language_model.model.layers.41.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 2048 |
"language_model.model.layers.41.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 2049 |
"language_model.model.layers.41.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 2050 |
-
"language_model.model.layers.41.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
|
| 2051 |
-
"language_model.model.layers.41.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
|
| 2052 |
-
"language_model.model.layers.41.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
|
| 2053 |
-
"language_model.model.layers.41.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
| 2054 |
"language_model.model.layers.41.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 2055 |
"language_model.model.layers.41.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 2056 |
"language_model.model.layers.41.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
@@ -2058,9 +1935,6 @@
|
|
| 2058 |
"language_model.model.layers.41.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 2059 |
"language_model.model.layers.41.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 2060 |
"language_model.model.layers.41.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
| 2061 |
-
"language_model.model.layers.41.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
|
| 2062 |
-
"language_model.model.layers.41.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 2063 |
-
"language_model.model.layers.41.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 2064 |
"language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 2065 |
"language_model.model.layers.5.layer_scalar": "model-00001-of-00002.safetensors",
|
| 2066 |
"language_model.model.layers.5.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
@@ -2237,6 +2111,8 @@
|
|
| 2237 |
"language_model.model.layers.9.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 2238 |
"language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 2239 |
"language_model.model.norm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
| 2240 |
"language_model.model.per_layer_model_projection.weight": "model-00002-of-00002.safetensors",
|
| 2241 |
"language_model.model.per_layer_projection_norm.weight": "model-00002-of-00002.safetensors",
|
| 2242 |
"vision_tower.encoder.layers.0.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
|
|
|
| 1 |
{
|
| 2 |
"metadata": {
|
| 3 |
+
"total_size": 8880624084
|
| 4 |
},
|
| 5 |
"weight_map": {
|
| 6 |
"audio_tower.layers.0.feed_forward1.ffw_layer_1.input_max": "model-00002-of-00002.safetensors",
|
|
|
|
| 1382 |
"language_model.model.layers.24.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1383 |
"language_model.model.layers.24.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1384 |
"language_model.model.layers.24.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1385 |
"language_model.model.layers.24.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1386 |
"language_model.model.layers.24.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1387 |
"language_model.model.layers.24.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1389 |
"language_model.model.layers.24.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1390 |
"language_model.model.layers.24.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1391 |
"language_model.model.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1392 |
"language_model.model.layers.25.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1393 |
"language_model.model.layers.25.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1394 |
"language_model.model.layers.25.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1410 |
"language_model.model.layers.25.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1411 |
"language_model.model.layers.25.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1412 |
"language_model.model.layers.25.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1413 |
"language_model.model.layers.25.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1414 |
"language_model.model.layers.25.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1415 |
"language_model.model.layers.25.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1417 |
"language_model.model.layers.25.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1418 |
"language_model.model.layers.25.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1419 |
"language_model.model.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1420 |
"language_model.model.layers.26.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1421 |
"language_model.model.layers.26.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1422 |
"language_model.model.layers.26.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1438 |
"language_model.model.layers.26.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1439 |
"language_model.model.layers.26.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1440 |
"language_model.model.layers.26.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1441 |
"language_model.model.layers.26.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1442 |
"language_model.model.layers.26.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1443 |
"language_model.model.layers.26.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1445 |
"language_model.model.layers.26.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1446 |
"language_model.model.layers.26.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1447 |
"language_model.model.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1448 |
"language_model.model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1449 |
"language_model.model.layers.27.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1450 |
"language_model.model.layers.27.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1466 |
"language_model.model.layers.27.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1467 |
"language_model.model.layers.27.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1468 |
"language_model.model.layers.27.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1469 |
"language_model.model.layers.27.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1470 |
"language_model.model.layers.27.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1471 |
"language_model.model.layers.27.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1473 |
"language_model.model.layers.27.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1474 |
"language_model.model.layers.27.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1475 |
"language_model.model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1476 |
"language_model.model.layers.28.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1477 |
"language_model.model.layers.28.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1478 |
"language_model.model.layers.28.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1494 |
"language_model.model.layers.28.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1495 |
"language_model.model.layers.28.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1496 |
"language_model.model.layers.28.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1497 |
"language_model.model.layers.28.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1498 |
"language_model.model.layers.28.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1499 |
"language_model.model.layers.28.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1501 |
"language_model.model.layers.28.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1502 |
"language_model.model.layers.28.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1503 |
"language_model.model.layers.28.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1504 |
"language_model.model.layers.29.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1505 |
"language_model.model.layers.29.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1506 |
"language_model.model.layers.29.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1522 |
"language_model.model.layers.29.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1523 |
"language_model.model.layers.29.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1524 |
"language_model.model.layers.29.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1525 |
"language_model.model.layers.29.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1526 |
"language_model.model.layers.29.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1527 |
"language_model.model.layers.29.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1529 |
"language_model.model.layers.29.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1530 |
"language_model.model.layers.29.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1531 |
"language_model.model.layers.29.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1532 |
"language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1533 |
"language_model.model.layers.3.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1534 |
"language_model.model.layers.3.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1585 |
"language_model.model.layers.30.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1586 |
"language_model.model.layers.30.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1587 |
"language_model.model.layers.30.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1588 |
"language_model.model.layers.30.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1589 |
"language_model.model.layers.30.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1590 |
"language_model.model.layers.30.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1592 |
"language_model.model.layers.30.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1593 |
"language_model.model.layers.30.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1594 |
"language_model.model.layers.30.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1595 |
"language_model.model.layers.31.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1596 |
"language_model.model.layers.31.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1597 |
"language_model.model.layers.31.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1613 |
"language_model.model.layers.31.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1614 |
"language_model.model.layers.31.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1615 |
"language_model.model.layers.31.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1616 |
"language_model.model.layers.31.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1617 |
"language_model.model.layers.31.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1618 |
"language_model.model.layers.31.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1620 |
"language_model.model.layers.31.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1621 |
"language_model.model.layers.31.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1622 |
"language_model.model.layers.31.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1623 |
"language_model.model.layers.32.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1624 |
"language_model.model.layers.32.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1625 |
"language_model.model.layers.32.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1641 |
"language_model.model.layers.32.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1642 |
"language_model.model.layers.32.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1643 |
"language_model.model.layers.32.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1644 |
"language_model.model.layers.32.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1645 |
"language_model.model.layers.32.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1646 |
"language_model.model.layers.32.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1648 |
"language_model.model.layers.32.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1649 |
"language_model.model.layers.32.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1650 |
"language_model.model.layers.32.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1651 |
"language_model.model.layers.33.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1652 |
"language_model.model.layers.33.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1653 |
"language_model.model.layers.33.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1669 |
"language_model.model.layers.33.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1670 |
"language_model.model.layers.33.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1671 |
"language_model.model.layers.33.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1672 |
"language_model.model.layers.33.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1673 |
"language_model.model.layers.33.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1674 |
"language_model.model.layers.33.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1676 |
"language_model.model.layers.33.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1677 |
"language_model.model.layers.33.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1678 |
"language_model.model.layers.33.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1679 |
"language_model.model.layers.34.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1680 |
"language_model.model.layers.34.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1681 |
"language_model.model.layers.34.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1697 |
"language_model.model.layers.34.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1698 |
"language_model.model.layers.34.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1699 |
"language_model.model.layers.34.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1700 |
"language_model.model.layers.34.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1701 |
"language_model.model.layers.34.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1702 |
"language_model.model.layers.34.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1704 |
"language_model.model.layers.34.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1705 |
"language_model.model.layers.34.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1706 |
"language_model.model.layers.34.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1707 |
"language_model.model.layers.35.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1708 |
"language_model.model.layers.35.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1709 |
"language_model.model.layers.35.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1725 |
"language_model.model.layers.35.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1726 |
"language_model.model.layers.35.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1727 |
"language_model.model.layers.35.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1728 |
"language_model.model.layers.35.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1729 |
"language_model.model.layers.35.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1730 |
"language_model.model.layers.35.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1732 |
"language_model.model.layers.35.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1733 |
"language_model.model.layers.35.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1734 |
"language_model.model.layers.35.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1735 |
"language_model.model.layers.36.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1736 |
"language_model.model.layers.36.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1737 |
"language_model.model.layers.36.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1753 |
"language_model.model.layers.36.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1754 |
"language_model.model.layers.36.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1755 |
"language_model.model.layers.36.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1756 |
"language_model.model.layers.36.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1757 |
"language_model.model.layers.36.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1758 |
"language_model.model.layers.36.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1760 |
"language_model.model.layers.36.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1761 |
"language_model.model.layers.36.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1762 |
"language_model.model.layers.36.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1763 |
"language_model.model.layers.37.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1764 |
"language_model.model.layers.37.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1765 |
"language_model.model.layers.37.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1781 |
"language_model.model.layers.37.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1782 |
"language_model.model.layers.37.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1783 |
"language_model.model.layers.37.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1784 |
"language_model.model.layers.37.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1785 |
"language_model.model.layers.37.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1786 |
"language_model.model.layers.37.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1788 |
"language_model.model.layers.37.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1789 |
"language_model.model.layers.37.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1790 |
"language_model.model.layers.37.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1791 |
"language_model.model.layers.38.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1792 |
"language_model.model.layers.38.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1793 |
"language_model.model.layers.38.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1809 |
"language_model.model.layers.38.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1810 |
"language_model.model.layers.38.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1811 |
"language_model.model.layers.38.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1812 |
"language_model.model.layers.38.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1813 |
"language_model.model.layers.38.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1814 |
"language_model.model.layers.38.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1816 |
"language_model.model.layers.38.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1817 |
"language_model.model.layers.38.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1818 |
"language_model.model.layers.38.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1819 |
"language_model.model.layers.39.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1820 |
"language_model.model.layers.39.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1821 |
"language_model.model.layers.39.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1837 |
"language_model.model.layers.39.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1838 |
"language_model.model.layers.39.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1839 |
"language_model.model.layers.39.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1840 |
"language_model.model.layers.39.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1841 |
"language_model.model.layers.39.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1842 |
"language_model.model.layers.39.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1844 |
"language_model.model.layers.39.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1845 |
"language_model.model.layers.39.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1846 |
"language_model.model.layers.39.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1847 |
"language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1848 |
"language_model.model.layers.4.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1849 |
"language_model.model.layers.4.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1900 |
"language_model.model.layers.40.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1901 |
"language_model.model.layers.40.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1902 |
"language_model.model.layers.40.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1903 |
"language_model.model.layers.40.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1904 |
"language_model.model.layers.40.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1905 |
"language_model.model.layers.40.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1907 |
"language_model.model.layers.40.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1908 |
"language_model.model.layers.40.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1909 |
"language_model.model.layers.40.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1910 |
"language_model.model.layers.41.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1911 |
"language_model.model.layers.41.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1912 |
"language_model.model.layers.41.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 1928 |
"language_model.model.layers.41.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1929 |
"language_model.model.layers.41.post_per_layer_input_norm.weight": "model-00001-of-00002.safetensors",
|
| 1930 |
"language_model.model.layers.41.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1931 |
"language_model.model.layers.41.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
|
| 1932 |
"language_model.model.layers.41.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
|
| 1933 |
"language_model.model.layers.41.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
| 1935 |
"language_model.model.layers.41.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
|
| 1936 |
"language_model.model.layers.41.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
|
| 1937 |
"language_model.model.layers.41.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
|
|
|
|
|
|
|
|
|
| 1938 |
"language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
| 1939 |
"language_model.model.layers.5.layer_scalar": "model-00001-of-00002.safetensors",
|
| 1940 |
"language_model.model.layers.5.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
|
|
|
|
| 2111 |
"language_model.model.layers.9.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
|
| 2112 |
"language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
| 2113 |
"language_model.model.norm.weight": "model-00001-of-00002.safetensors",
|
| 2114 |
+
"language_model.model.per_layer_model_projection.biases": "model-00002-of-00002.safetensors",
|
| 2115 |
+
"language_model.model.per_layer_model_projection.scales": "model-00002-of-00002.safetensors",
|
| 2116 |
"language_model.model.per_layer_model_projection.weight": "model-00002-of-00002.safetensors",
|
| 2117 |
"language_model.model.per_layer_projection_norm.weight": "model-00002-of-00002.safetensors",
|
| 2118 |
"vision_tower.encoder.layers.0.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
processor_config.json
CHANGED
|
@@ -29,6 +29,27 @@
|
|
| 29 |
},
|
| 30 |
"image_seq_length": 280,
|
| 31 |
"processor_class": "Gemma4Processor",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 32 |
"feature_extractor": {
|
| 33 |
"feature_extractor_type": "Gemma4AudioFeatureExtractor",
|
| 34 |
"sampling_rate": 16000,
|
|
|
|
| 29 |
},
|
| 30 |
"image_seq_length": 280,
|
| 31 |
"processor_class": "Gemma4Processor",
|
| 32 |
+
"video_processor": {
|
| 33 |
+
"default_fps": 2.0,
|
| 34 |
+
"do_normalize": true,
|
| 35 |
+
"do_rescale": true,
|
| 36 |
+
"image_mean": [
|
| 37 |
+
0.0,
|
| 38 |
+
0.0,
|
| 39 |
+
0.0
|
| 40 |
+
],
|
| 41 |
+
"image_std": [
|
| 42 |
+
1.0,
|
| 43 |
+
1.0,
|
| 44 |
+
1.0
|
| 45 |
+
],
|
| 46 |
+
"max_soft_tokens": 70,
|
| 47 |
+
"num_frames": 32,
|
| 48 |
+
"patch_size": 16,
|
| 49 |
+
"pooling_kernel_size": 3,
|
| 50 |
+
"rescale_factor": 0.00392156862745098,
|
| 51 |
+
"video_processor_type": "Gemma4VideoProcessor"
|
| 52 |
+
},
|
| 53 |
"feature_extractor": {
|
| 54 |
"feature_extractor_type": "Gemma4AudioFeatureExtractor",
|
| 55 |
"sampling_rate": 16000,
|
tokenizer_config.json
CHANGED
|
@@ -17,50 +17,72 @@
|
|
| 17 |
"<|video|>"
|
| 18 |
],
|
| 19 |
"image_token": "<|image|>",
|
|
|
|
|
|
|
| 20 |
"mask_token": "<mask>",
|
| 21 |
"model_max_length": 1000000000000000019884624838656,
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 22 |
"pad_token": "<pad>",
|
| 23 |
"padding_side": "left",
|
| 24 |
"processor_class": "Gemma4Processor",
|
| 25 |
"response_schema": {
|
| 26 |
-
"type": "object",
|
| 27 |
"properties": {
|
|
|
|
|
|
|
|
|
|
| 28 |
"role": {
|
| 29 |
"const": "assistant"
|
| 30 |
},
|
| 31 |
"thinking": {
|
| 32 |
"type": "string"
|
| 33 |
},
|
| 34 |
-
"content": {
|
| 35 |
-
"type": "string"
|
| 36 |
-
},
|
| 37 |
"tool_calls": {
|
| 38 |
-
"x-regex-iterator": "<\\|tool_call>(.*?)<tool_call\\|>",
|
| 39 |
-
"type": "array",
|
| 40 |
"items": {
|
| 41 |
-
"type": "object",
|
| 42 |
"properties": {
|
| 43 |
-
"type": {
|
| 44 |
-
"const": "function"
|
| 45 |
-
},
|
| 46 |
"function": {
|
| 47 |
-
"type": "object",
|
| 48 |
-
"x-regex": "call\\:(?P<name>\\w+)(?P<arguments>\\{.*\\})",
|
| 49 |
"properties": {
|
| 50 |
-
"name": {
|
| 51 |
-
"type": "string"
|
| 52 |
-
},
|
| 53 |
"arguments": {
|
|
|
|
| 54 |
"type": "object",
|
| 55 |
-
"x-parser": "gemma4-tool-call"
|
| 56 |
-
|
|
|
|
|
|
|
| 57 |
}
|
| 58 |
-
}
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 59 |
}
|
| 60 |
-
}
|
| 61 |
-
|
|
|
|
|
|
|
|
|
|
| 62 |
}
|
| 63 |
},
|
|
|
|
| 64 |
"x-regex": "(\\<\\|channel\\>thought\\n(?P<thinking>.*?)\\<channel\\|\\>)?(?P<tool_calls>\\<\\|tool_call\\>.*\\<tool_call\\|\\>)?(?P<content>(?:(?!\\<turn\\|\\>)(?!\\<\\|tool_response\\>).)+)?(?:\\<turn\\|\\>|\\<\\|tool_response\\>)?"
|
| 65 |
},
|
| 66 |
"soc_token": "<|channel>",
|
|
|
|
| 17 |
"<|video|>"
|
| 18 |
],
|
| 19 |
"image_token": "<|image|>",
|
| 20 |
+
"is_local": true,
|
| 21 |
+
"local_files_only": true,
|
| 22 |
"mask_token": "<mask>",
|
| 23 |
"model_max_length": 1000000000000000019884624838656,
|
| 24 |
+
"model_specific_special_tokens": {
|
| 25 |
+
"audio_token": "<|audio|>",
|
| 26 |
+
"boa_token": "<|audio>",
|
| 27 |
+
"boi_token": "<|image>",
|
| 28 |
+
"eoa_token": "<audio|>",
|
| 29 |
+
"eoc_token": "<channel|>",
|
| 30 |
+
"eoi_token": "<image|>",
|
| 31 |
+
"eot_token": "<turn|>",
|
| 32 |
+
"escape_token": "<|\"|>",
|
| 33 |
+
"etc_token": "<tool_call|>",
|
| 34 |
+
"etd_token": "<tool|>",
|
| 35 |
+
"etr_token": "<tool_response|>",
|
| 36 |
+
"image_token": "<|image|>",
|
| 37 |
+
"soc_token": "<|channel>",
|
| 38 |
+
"sot_token": "<|turn>",
|
| 39 |
+
"stc_token": "<|tool_call>",
|
| 40 |
+
"std_token": "<|tool>",
|
| 41 |
+
"str_token": "<|tool_response>",
|
| 42 |
+
"think_token": "<|think|>"
|
| 43 |
+
},
|
| 44 |
"pad_token": "<pad>",
|
| 45 |
"padding_side": "left",
|
| 46 |
"processor_class": "Gemma4Processor",
|
| 47 |
"response_schema": {
|
|
|
|
| 48 |
"properties": {
|
| 49 |
+
"content": {
|
| 50 |
+
"type": "string"
|
| 51 |
+
},
|
| 52 |
"role": {
|
| 53 |
"const": "assistant"
|
| 54 |
},
|
| 55 |
"thinking": {
|
| 56 |
"type": "string"
|
| 57 |
},
|
|
|
|
|
|
|
|
|
|
| 58 |
"tool_calls": {
|
|
|
|
|
|
|
| 59 |
"items": {
|
|
|
|
| 60 |
"properties": {
|
|
|
|
|
|
|
|
|
|
| 61 |
"function": {
|
|
|
|
|
|
|
| 62 |
"properties": {
|
|
|
|
|
|
|
|
|
|
| 63 |
"arguments": {
|
| 64 |
+
"additionalProperties": {},
|
| 65 |
"type": "object",
|
| 66 |
+
"x-parser": "gemma4-tool-call"
|
| 67 |
+
},
|
| 68 |
+
"name": {
|
| 69 |
+
"type": "string"
|
| 70 |
}
|
| 71 |
+
},
|
| 72 |
+
"type": "object",
|
| 73 |
+
"x-regex": "call\\:(?P<name>\\w+)(?P<arguments>\\{.*\\})"
|
| 74 |
+
},
|
| 75 |
+
"type": {
|
| 76 |
+
"const": "function"
|
| 77 |
}
|
| 78 |
+
},
|
| 79 |
+
"type": "object"
|
| 80 |
+
},
|
| 81 |
+
"type": "array",
|
| 82 |
+
"x-regex-iterator": "<\\|tool_call>(.*?)<tool_call\\|>"
|
| 83 |
}
|
| 84 |
},
|
| 85 |
+
"type": "object",
|
| 86 |
"x-regex": "(\\<\\|channel\\>thought\\n(?P<thinking>.*?)\\<channel\\|\\>)?(?P<tool_calls>\\<\\|tool_call\\>.*\\<tool_call\\|\\>)?(?P<content>(?:(?!\\<turn\\|\\>)(?!\\<\\|tool_response\\>).)+)?(?:\\<turn\\|\\>|\\<\\|tool_response\\>)?"
|
| 87 |
},
|
| 88 |
"soc_token": "<|channel>",
|