Upload 6 files
Browse files訓練 tokenizer 增加 Python 程式碼資料集以及維基文庫,訓練時增加維基文庫。模型學會了古文、古詩詞的語法。
- config.json +3 -2
- model.safetensors +2 -2
- modeling_kuixing.py +2 -2
- tokenizer.json +0 -0
- tokenizer.model +2 -2
config.json
CHANGED
|
@@ -7,7 +7,7 @@
|
|
| 7 |
"AutoConfig": "modeling_kuixing.KuiXingHFConfig",
|
| 8 |
"AutoModelForCausalLM": "modeling_kuixing.KuiXingForCausalLM"
|
| 9 |
},
|
| 10 |
-
"vocab_size":
|
| 11 |
"hidden_size": 2400,
|
| 12 |
"num_hidden_layers": 16,
|
| 13 |
"num_attention_heads": 32,
|
|
@@ -18,5 +18,6 @@
|
|
| 18 |
"pad_token_id": 0,
|
| 19 |
"bos_token_id": 2,
|
| 20 |
"eos_token_id": 3,
|
| 21 |
-
"torch_dtype": "float32"
|
|
|
|
| 22 |
}
|
|
|
|
| 7 |
"AutoConfig": "modeling_kuixing.KuiXingHFConfig",
|
| 8 |
"AutoModelForCausalLM": "modeling_kuixing.KuiXingForCausalLM"
|
| 9 |
},
|
| 10 |
+
"vocab_size": 112640,
|
| 11 |
"hidden_size": 2400,
|
| 12 |
"num_hidden_layers": 16,
|
| 13 |
"num_attention_heads": 32,
|
|
|
|
| 18 |
"pad_token_id": 0,
|
| 19 |
"bos_token_id": 2,
|
| 20 |
"eos_token_id": 3,
|
| 21 |
+
"torch_dtype": "float32",
|
| 22 |
+
"transformers_version": "5.9.0"
|
| 23 |
}
|
model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d3c1c605200c53792654eec2ac99ec76cac9b2387ef664c3e3e3876981269da5
|
| 3 |
+
size 5515185528
|
modeling_kuixing.py
CHANGED
|
@@ -19,7 +19,7 @@ class KuiXingHFConfig(PretrainedConfig):
|
|
| 19 |
model_type = "kuixing"
|
| 20 |
def __init__(
|
| 21 |
self,
|
| 22 |
-
vocab_size=
|
| 23 |
hidden_size=2400,
|
| 24 |
num_hidden_layers=16,
|
| 25 |
num_attention_heads=32,
|
|
@@ -160,7 +160,7 @@ class KuiXingForCausalLM(PreTrainedModel, GenerationMixin):
|
|
| 160 |
# lm_head.weight 是刻意省略的(weight tying),從 missing 中排除再判斷
|
| 161 |
missing = [k for k in missing if k != "model.lm_head.weight"]
|
| 162 |
if not missing and not unexpected:
|
| 163 |
-
print("✅ 所有權重 key 完整對映,無缺漏。")
|
| 164 |
else:
|
| 165 |
if missing: print(f"⚠️ 缺少 key({len(missing)}):{missing[:5]}")
|
| 166 |
if unexpected: print(f"⚠️ 多餘 key({len(unexpected)}):{unexpected[:5]}")
|
|
|
|
| 19 |
model_type = "kuixing"
|
| 20 |
def __init__(
|
| 21 |
self,
|
| 22 |
+
vocab_size=112640,
|
| 23 |
hidden_size=2400,
|
| 24 |
num_hidden_layers=16,
|
| 25 |
num_attention_heads=32,
|
|
|
|
| 160 |
# lm_head.weight 是刻意省略的(weight tying),從 missing 中排除再判斷
|
| 161 |
missing = [k for k in missing if k != "model.lm_head.weight"]
|
| 162 |
if not missing and not unexpected:
|
| 163 |
+
print("✅ 魁星所有權重 key 完整對映,無缺漏。")
|
| 164 |
else:
|
| 165 |
if missing: print(f"⚠️ 缺少 key({len(missing)}):{missing[:5]}")
|
| 166 |
if unexpected: print(f"⚠️ 多餘 key({len(unexpected)}):{unexpected[:5]}")
|
tokenizer.json
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
tokenizer.model
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:13698a9916d5f488fcabeec6dc9bd6de65986ae171911ed6c5ab4af43b22c849
|
| 3 |
+
size 1846838
|