Update README.md
Browse files
README.md
CHANGED
|
@@ -1,3 +1,89 @@
|
|
| 1 |
---
|
| 2 |
license: bsd-3-clause
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 3 |
---
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
---
|
| 2 |
license: bsd-3-clause
|
| 3 |
+
language:
|
| 4 |
+
- zh
|
| 5 |
+
- en
|
| 6 |
+
pipeline_tag: text-generation
|
| 7 |
+
tags:
|
| 8 |
+
- chinese
|
| 9 |
+
- rnn
|
| 10 |
+
- lstm
|
| 11 |
+
- transformer
|
| 12 |
+
- seq2seq
|
| 13 |
+
- tutorial
|
| 14 |
+
- educational
|
| 15 |
+
- cpu
|
| 16 |
+
- mobile
|
| 17 |
---
|
| 18 |
+
|
| 19 |
+
# 春梦蝶最小示例模型集合
|
| 20 |
+
|
| 21 |
+
## 项目简介
|
| 22 |
+
|
| 23 |
+
这是一个从零开始、逐级递进的**最小示例模型集合**,展示了如何用最少的代码和数据,在手机上训练出能“说话”的猫娘模型。
|
| 24 |
+
|
| 25 |
+
从最简单的字符级 RNN 到带注意力的 Seq2Seq,每个版本都是一个独立可运行的**最小单元**。
|
| 26 |
+
|
| 27 |
+
## 五个版本
|
| 28 |
+
|
| 29 |
+
| 版本 | 目录 | 架构 | 权重状态 | 说明 |
|
| 30 |
+
|------|------|------|---------|------|
|
| 31 |
+
| v1 | `v1_rnn_mini` | 单层 RNN | ✅ 提供 | 最小的能说话模型,约 2 万参数 |
|
| 32 |
+
| v2 | `v2_rnn_expanded` | 单层 RNN | ✅ 提供 | 语料扩充至 2500 字 |
|
| 33 |
+
| v3 | `v3_lstm` | 双层 LSTM | ✅ 提供 | 从 RNN 升级到 LSTM,约 40 万参数 |
|
| 34 |
+
| v4 | `v4_transformer` | 极简 Transformer | ❌ 未提供 | 手机 CPU 训练效果不佳,代码保留供参考 |
|
| 35 |
+
| v5 | `v5_seq2seq_attention` | Seq2Seq + Attention | ❌ 未提供 | 2100 万参数,超出手机性能,代码保留供参考 |
|
| 36 |
+
|
| 37 |
+
## 项目特点
|
| 38 |
+
|
| 39 |
+
- **在手机上训练和运行**:所有脚本均在 ZeroTermux(Android)环境下完成
|
| 40 |
+
- **极低门槛**:只需 Python + PyTorch(CPU 版),无需 GPU
|
| 41 |
+
- **真正的“最小示例”**:从几十行代码开始,逐步演进到更复杂的架构
|
| 42 |
+
- **开箱即用**:有提供权重的版本,直接 `python run.py` 即可聊天
|
| 43 |
+
|
| 44 |
+
## 权重说明
|
| 45 |
+
|
| 46 |
+
- v1、v2、v3:提供训练完成的最终权重(`final.pth`)
|
| 47 |
+
- v4:因手机 CPU 训练效果差,只提供代码,不提供权重
|
| 48 |
+
- v5:因参数量过大(2100万),超出手机性能,只提供代码参考
|
| 49 |
+
|
| 50 |
+
> 中间 checkpoint 因文件大小和存储限制未包含在仓库中,如需完整训练日志或中间版本,可自行运行训练脚本生成。
|
| 51 |
+
|
| 52 |
+
## 如何使用
|
| 53 |
+
|
| 54 |
+
### 手机端(ZeroTermux)
|
| 55 |
+
|
| 56 |
+
1. 安装 [ZeroTermux](https://github.com/hanxinhao000/ZeroTermux)
|
| 57 |
+
2. 安装依赖:
|
| 58 |
+
```bash
|
| 59 |
+
pkg update && pkg upgrade
|
| 60 |
+
pkg install python python-torch python-numpy
|
| 61 |
+
```
|
| 62 |
+
3. 克隆本仓库:
|
| 63 |
+
```bash
|
| 64 |
+
git clone https://huggingface.co/XingChina/ChunMengDie-Mini-Examples
|
| 65 |
+
cd ChunMengDie-Mini-Examples
|
| 66 |
+
```
|
| 67 |
+
4. 进入任意子目录(如 `v1_rnn_mini/`):
|
| 68 |
+
```bash
|
| 69 |
+
cd v1_rnn_mini
|
| 70 |
+
python run.py
|
| 71 |
+
```
|
| 72 |
+
|
| 73 |
+
### 电脑端
|
| 74 |
+
|
| 75 |
+
```bash
|
| 76 |
+
pip install torch numpy
|
| 77 |
+
git clone https://huggingface.co/XingChina/ChunMengDie-Mini-Examples
|
| 78 |
+
cd ChunMengDie-Mini-Examples/v1_rnn_mini
|
| 79 |
+
python run.py
|
| 80 |
+
```
|
| 81 |
+
|
| 82 |
+
## 许可证
|
| 83 |
+
|
| 84 |
+
本项目采用 **BSD 3-Clause** 许可证。详见 [LICENSE](./LICENSE) 文件。
|
| 85 |
+
|
| 86 |
+
## 相关项目
|
| 87 |
+
|
| 88 |
+
- [ChunMengDie-1.0-0.4B](https://huggingface.co/XingChina/ChunMengDie-1.0-0.4B) —— 4 亿参数的“大模型”(实验阶段)
|
| 89 |
+
- 本项目是该大模型的“最小可解释版本”集合
|