Yuaz-mini-Cheng DX 1B

从零训练的 972M 参数中文对话模型。基于 LCCC + NaturalConv 数据集。

使用方法

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model = AutoModelForCausalLM.from_pretrained(
    "Yuaz-Club/yuaz-mini-cheng-dx-1b",
    trust_remote_code=True,
    torch_dtype=torch.float16
)
tokenizer = AutoTokenizer.from_pretrained("Yuaz-Club/yuaz-mini-cheng-dx-1b", trust_remote_code=True)

inputs = tokenizer("你好", return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=60)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

模型参数

参数
参数量 972M
层数 28
隐藏层 1792
注意力头 28 (GQA 4:1, 7 KV heads)
FFN 4864 (SwiGLU)
词表 8192 (BPE)
位置编码 RoPE
训练数据 314 万对话

模型文件

文件 大小 格式
pytorch_model.bin 1.8 GB FP16
Downloads last month
9
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Space using Yuaz-Club/yuaz-mini-cheng-dx-1b 1