xxzigou commited on
Commit
ba72f6b
·
verified ·
1 Parent(s): 8636bc5

updatre readme

Browse files
Files changed (1) hide show
  1. README.md +123 -0
README.md CHANGED
@@ -1,3 +1,126 @@
1
  ---
2
  license: apache-2.0
 
 
 
 
 
 
 
 
 
 
 
3
  ---
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
  ---
2
  license: apache-2.0
3
+ library_name: ncnn
4
+ tags:
5
+ - ocr
6
+ - image-to-text
7
+ - ncnn
8
+ - cpp
9
+ - multimodal
10
+ - vision
11
+ - hunyuan
12
+ - tencent
13
+ base_model: tencent/HunyuanOCR
14
  ---
15
+
16
+ # HunyuanOCR-ncnn
17
+
18
+ 腾讯 [HunyuanOCR](https://huggingface.co/tencent/HunyuanOCR) 的 ncnn 推理权重。基于 stock ncnn(上游原版,不做任何代码修改),通过 `add_bin_headers.py` 后处理适配 ncnn 的权重加载格式。
19
+
20
+ 需要配合 C++ 推理框架 [hunyuan-ocr-ncnn](https://github.com/YOUR_USERNAME/HunyuanOCR-ncnn) 使用。
21
+
22
+ ## 模型信息
23
+
24
+ | 属性 | 值 |
25
+ |------|-----|
26
+ | 原始模型 | [tencent/HunyuanOCR](https://huggingface.co/tencent/HunyuanOCR)(~1B 参数) |
27
+ | 架构 | HunYuanVL(ViT + LLM 多模态) |
28
+ | 视觉编码器 | 27 层 ViT,hidden=1152,16 heads,patch_size=16 |
29
+ | PatchMerger | RMSNorm → Conv2d(stride=2) → GELU → Conv2d(1x1) → GELU → Linear → RMSNorm |
30
+ | LLM Decoder | 24 层 GQA,hidden=1024,16 heads / 8 kv heads,head_dim=128,intermediate=3584 |
31
+ | LM Head | 1024 → 120818(词嵌入权重共享) |
32
+ | 位置编码 | XD-RoPE(4 轴 mRoPE,sections=[16,16,16,16])+ 64 维标准 1D RoPE |
33
+ | Tokenizer | SentencePiece BPE(ByteLevel,120818 词表) |
34
+ | 最大位置 | 32768 tokens |
35
+ | 数据类型 | float32(未做 fp16 量化) |
36
+
37
+ ## 文件说明
38
+
39
+ | 文件 | 大小 | 说明 |
40
+ |------|------|------|
41
+ | `model.json` | ~1 KB | 运行时配置(层数、维度、文件映射) |
42
+ | `vision_encoder.ncnn.param` | ~25 KB | ViT 网络结构 |
43
+ | `vision_encoder.ncnn.bin` | ~1.7 GB | ViT 权重(已添加 flag_struct 头) |
44
+ | `decoder.ncnn.param` | ~85 KB | LLM 网络结构(已移除 Cast 层) |
45
+ | `decoder.ncnn.bin` | ~1.6 GB | LLM 权重(已添加 flag_struct 头) |
46
+ | `embed.ncnn.param` | ~165 B | 词嵌入结构 |
47
+ | `embed.ncnn.bin` | ~472 MB | 词嵌入权重(120818 x 1024) |
48
+ | `lm_head.ncnn.param` | ~179 B | LM head 结构 |
49
+ | `lm_head.ncnn.bin` | ~472 MB | LM head 权重 |
50
+ | `projector.ncnn.param` | ~178 B | 投影层结构 |
51
+ | `projector.ncnn.bin` | ~4 MB | 投影层权重 |
52
+ | `perceptron_weights.bin` | ~117 MB | PatchMerger 权重(C++ 直读) |
53
+ | `pos_embed_32x32.bin` | ~5 MB | ViT 位置嵌入(32x32 网格) |
54
+ | `image_begin.bin` | 4 KB | 图像开始标记嵌入 |
55
+ | `image_end.bin` | 4 KB | 图像结束标记嵌入 |
56
+ | `image_newline.bin` | 4 KB | 图像换行标记嵌入 |
57
+ | `vocab.txt` | ~1.6 MB | Tokenizer 词表(120818 tokens) |
58
+ | `merges.txt` | ~1.6 MB | BPE 合并规则(119758 条) |
59
+
60
+ **总计:约 4.5 GB**
61
+
62
+ ## 转换流程
63
+
64
+ 原始 PyTorch 模型经过以下步骤转换为 ncnn 格式:
65
+
66
+ 1. **ONNX 导出**:`torch.onnx.export` 将各子模型导出为 ONNX
67
+ 2. **pnnx 转换**:ONNX → ncnn param/bin(flat 图,避免 torchscript inline 崩溃)
68
+ 3. **权重后处理**:`add_bin_headers.py` 为 type=0 权重添加 4 字节 flag_struct 头,适配 stock ncnn 的 `ModelBin` 加载格式
69
+ 4. **Param 修补**:删除 decoder 中 fp16 导出产生的 Cast 层(stock ncnn 的 Cast 层会丢失 batch 维度)
70
+
71
+ 所有处理步骤均在推理框架仓库的 `tools/` 和 `export/` 目录下。
72
+
73
+ ## 使用方法
74
+
75
+ ### 1. 下载权重
76
+
77
+ ```bash
78
+ pip install huggingface_hub
79
+ huggingface-cli download xxzigou/HunyuanOCR-ncnn --local-dir assets/hunyuan_ocr_ncnn
80
+ ```
81
+
82
+ ### 2. 编译推理框架
83
+
84
+ 详见 [hunyuan-ocr-ncnn 仓库](https://github.com/YOUR_USERNAME/HunyuanOCR-ncnn) 的 README。简要步骤:
85
+
86
+ ```powershell
87
+ # 编译 stock ncnn
88
+ cd ncnn
89
+ cmake -B build -G "MinGW Makefiles" -DCMAKE_BUILD_TYPE=Release -DNCNN_AVX=OFF -DNCNN_OPENMP=ON
90
+ cmake --build build --config Release -j8
91
+ cmake --install build --config Release
92
+
93
+ # 编译推理框架
94
+ cd hunyuan-ocr-ncnn
95
+ cmake -B build -G "MinGW Makefiles" -DCMAKE_BUILD_TYPE=Release -Dncnn_DIR=C:/ncnn/build/install/lib/cmake/ncnn -DNCNN_SRC_DIR=C:/ncnn
96
+ cmake --build build --config Release -j8
97
+ ```
98
+
99
+ ### 3. 运行 OCR
100
+
101
+ ```powershell
102
+ .\build\hunyuan_ocr.exe --model assets/hunyuan_ocr_ncnn --image document.png --threads 4 --stream
103
+ ```
104
+
105
+ ## 性能参考
106
+
107
+ | 配置 | 生成速度 |
108
+ |------|---------|
109
+ | CPU 4 线程,full-forward(无 KV cache) | ~6 s/tok |
110
+
111
+ 当前 decoder 为 full-forward 模式(每步重算完整序列),无 KV cache。长序列性能随序列长度二次增长。
112
+
113
+ ## 已知限制
114
+
115
+ - 无 KV cache,长序列生成较慢
116
+ - float32 推理,未做量化(int8/fp16)
117
+ - AVX 关闭以保证数值正确性
118
+ - 静态序列长度 512(超出需重新导出)
119
+
120
+ ## 致谢
121
+
122
+ 本权重基于腾讯 [HunyuanOCR](https://huggingface.co/tencent/HunyuanOCR) 模型转换而来。感谢腾讯开源的 OCR 模型和 [ncnn](https://github.com/Tencent/ncnn) 推理框架。
123
+
124
+ ## 许可
125
+
126
+ 权重文件继承原始模型的 [Apache-2.0](https://opensource.org/licenses/Apache-2.0) 许可。