Add files using upload-large-folder tool

Browse files

Files changed (8) hide show

config.json +2 -1
generation_config.json +1 -1
model-00001-of-00004.safetensors +2 -2
model-00002-of-00004.safetensors +2 -2
model-00003-of-00004.safetensors +2 -2
model-00004-of-00004.safetensors +2 -2
model.safetensors.index.json +37 -37
tokenizer_config.json +1 -0

config.json CHANGED Viewed

@@ -1,4 +1,5 @@
 {
   "architectures": [
     "LlamaForCausalLM"
   ],
@@ -34,7 +35,7 @@
   "rope_theta": 500000.0,
   "tie_word_embeddings": false,
   "torch_dtype": "bfloat16",
-  "transformers_version": "4.46.3",
   "unsloth_version": "2024.11.9",
   "use_cache": true,
   "vocab_size": 128256

 {
+  "_name_or_path": "/data/nodes/tao/training/local_models/m1h1k1_father_of_forest",
   "architectures": [
     "LlamaForCausalLM"
   ],
   "rope_theta": 500000.0,
   "tie_word_embeddings": false,
   "torch_dtype": "bfloat16",
+  "transformers_version": "4.47.0",
   "unsloth_version": "2024.11.9",
   "use_cache": true,
   "vocab_size": 128256

generation_config.json CHANGED Viewed

@@ -10,5 +10,5 @@
   "pad_token_id": 128004,
   "temperature": 0.6,
   "top_p": 0.9,
-  "transformers_version": "4.46.3"
 }

   "pad_token_id": 128004,
   "temperature": 0.6,
   "top_p": 0.9,
+  "transformers_version": "4.47.0"
 }

model-00001-of-00004.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:6566e6c6d08f726cd3e4cec641b53da0acd35a6b977666443b294841399a68bc
-size 4976698672

 version https://git-lfs.github.com/spec/v1
+oid sha256:0ab97aa2718a30d58af3d2b2f5970a3b5167dcda2ef5866912d27d30421769d6
+size 4624360176

model-00002-of-00004.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:897c65aa4b32fbfedd83e39df58f2f3b66c04ed759665e6f3ebe27b9a70027c7
-size 4999802720

 version https://git-lfs.github.com/spec/v1
+oid sha256:17aa2553875ebb1e8e8c10c8244982515ce85f0447c49e28d0f02378dbd1669c
+size 4714588976

model-00003-of-00004.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:2f110c3555c5df53d4738fdc167f08cc56a75762f3b36c576b05ac7f404fea00
-size 4915916176

 version https://git-lfs.github.com/spec/v1
+oid sha256:4a15347bc69b58ce8e00764a944991e859badb58d946be60119d295c7b54d6e0
+size 4681018304

model-00004-of-00004.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:45896a4165dddfcc42135f86e667ee349ac56f06fde2a4129feb0495d9166e97
-size 1168138808

 version https://git-lfs.github.com/spec/v1
+oid sha256:422650a464496f6aa1fbe6e3bb69a10e6d948764eb3d60fafbb4cc7383d02719
+size 2040588912

model.safetensors.index.json CHANGED Viewed

@@ -104,15 +104,15 @@
     "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors",
     "model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
@@ -124,13 +124,13 @@
     "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
-    "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
@@ -203,11 +203,11 @@
     "model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors",
-    "model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
@@ -221,24 +221,24 @@
     "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
-    "model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors",
-    "model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
-    "model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
-    "model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
-    "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors",
     "model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
@@ -275,11 +275,11 @@
     "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
-    "model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors",
-    "model.layers.8.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
-    "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
-    "model.layers.8.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
-    "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",

     "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.19.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.19.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.19.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.19.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.19.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.19.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.19.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.19.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors",
     "model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.input_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.layers.29.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
     "model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
     "model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.30.input_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.layers.30.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.30.mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.30.mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.30.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.layers.30.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.30.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.30.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.30.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.mlp.up_proj.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
     "model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors",
     "model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.8.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.8.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.8.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.8.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
     "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",

tokenizer_config.json CHANGED Viewed

@@ -2053,6 +2053,7 @@
   "chat_template": "{{- bos_token }}\n{{- \"<|start_header_id|>system<|end_header_id|>\\n\\n\" }}\n{{messages[0]['content']|trim}}{{- \"<|start_header_id|>user<|end_header_id|>\\n\\n\" -}}\n{{messages[1]['content']|trim}}<|eot_id|>{%- if add_generation_prompt %}\n    {{- '<|start_header_id|>assistant<|end_header_id|>\\n\\n' }}\n{%- if messages[2] is defined %}\n{{messages[2]['content']|trim}}<|eot_id|>{%- endif %}{%- endif %}\n",
   "clean_up_tokenization_spaces": true,
   "eos_token": "<|eot_id|>",
   "model_input_names": [
     "input_ids",
     "attention_mask"

   "chat_template": "{{- bos_token }}\n{{- \"<|start_header_id|>system<|end_header_id|>\\n\\n\" }}\n{{messages[0]['content']|trim}}{{- \"<|start_header_id|>user<|end_header_id|>\\n\\n\" -}}\n{{messages[1]['content']|trim}}<|eot_id|>{%- if add_generation_prompt %}\n    {{- '<|start_header_id|>assistant<|end_header_id|>\\n\\n' }}\n{%- if messages[2] is defined %}\n{{messages[2]['content']|trim}}<|eot_id|>{%- endif %}{%- endif %}\n",
   "clean_up_tokenization_spaces": true,
   "eos_token": "<|eot_id|>",
+  "extra_special_tokens": {},
   "model_input_names": [
     "input_ids",
     "attention_mask"