NovaAI6868 commited on
Commit
6265d23
·
verified ·
1 Parent(s): e4f803b

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +18 -23
README.md CHANGED
@@ -1,10 +1,7 @@
1
  ---
2
  language: zh
3
- license: gemma
4
- library_name: transformers
5
  tags:
6
- - gemma
7
- - gemma-4
8
  - multimodal
9
  - vision
10
  - audio
@@ -15,23 +12,22 @@ tags:
15
  pipeline_tag: image-text-to-text
16
  ---
17
 
18
- # BaiHu-v2
19
 
20
- BaiHu-v2 是一款基于 **Google Gemma 4** 架构的多模态大语言模型,支持文本、图像、音频与视频输入,适用于中文场景下的多模态理解与生成任务。
21
 
22
  ---
23
 
24
  ## 模型简介
25
 
26
- - **模型名称**: BaiHu-v2
27
- - **基座模型**: `unsloth/gemma-4-E2B-it`
28
  - **架构**: `Gemma4ForConditionalGeneration`
29
  - **上下文长度**: 131,072 tokens
30
  - **词表大小**: 262,144
31
  - **数据类型**: float16
32
  - **支持模态**: 文本 / 图像 / 音频 / 视频
33
 
34
- BaiHu-v2 在 Gemma 4 的多模态能力基础上进行了继续训练/微调,保留了原生 Gemma 4 对图像、音频、视频的理解能力,同时针对中文任务进行了优化。
35
 
36
  ---
37
 
@@ -39,11 +35,11 @@ BaiHu-v2 在 Gemma 4 的多模态能力基础上进行了继续训练/微调,
39
 
40
  | 文件 | 说明 |
41
  |------|------|
42
- | `BaiHu-v2.Q4_K_M.gguf` | 主模型 GGUF 量化版本(Q4_K_M),适合本地 CPU/GPU 推理 |
43
- | `BaiHu-v2.F16-mmproj.gguf` | 多模态投影层(mmproj)FP16 版本,配合主模型用于图像/音频/视频理解 |
44
  | `Modelfile` | llama.cpp / Ollama 的模型配置文件示例 |
45
 
46
- > 推荐搭配使用:`BaiHu-v2.Q4_K_M.gguf` + `BaiHu-v2.F16-mmproj.gguf`
47
 
48
  ---
49
 
@@ -53,7 +49,7 @@ BaiHu-v2 在 Gemma 4 的多模态能力基础上进行了继续训练/微调,
53
  - 图像描述与视觉问答
54
  - 音频内容理解
55
  - 视频内容理解
56
- - 工具调用(遵循 Gemma 4 原生工具调用格式)
57
 
58
  ---
59
 
@@ -64,16 +60,16 @@ BaiHu-v2 在 Gemma 4 的多模态能力基础上进行了继续训练/微调,
64
  参考仓库中的 `Modelfile` 创建 Ollama 模型:
65
 
66
  ```bash
67
- ollama create BaiHu-v2 -f Modelfile
68
- ollama run BaiHu-v2
69
  ```
70
 
71
  ### 使用 llama.cpp 命令行
72
 
73
  ```bash
74
  ./llama-cli \
75
- -m BaiHu-v2.Q4_K_M.gguf \
76
- --mmproj BaiHu-v2.F16-mmproj.gguf \
77
  --image example.jpg \
78
  -p "请描述这张图片:"
79
  ```
@@ -86,9 +82,9 @@ ollama run BaiHu-v2
86
 
87
  ## 模型配置
88
 
89
- - **文本模型**: Gemma 4 Text,35 层,隐藏维度 1536,8 头注意力
90
- - **视觉编码器**: Gemma 4 Vision,16 层,隐藏维度 768,图像 token 数 280
91
- - **音频编码器**: Gemma 4 Audio,12 层,隐藏维度 1024
92
  - **视频**: 支持 32 帧采样,每帧最大 70 个 soft token
93
 
94
  ---
@@ -103,18 +99,17 @@ ollama run BaiHu-v2
103
 
104
  ## 免责声明
105
 
106
- 本模型基于 Gemma 4 进行微调,生成的内容可能受训练数据影响。请勿将模型输出作为专业建议(医疗、法律、金融等)使用。模型可能存在幻觉、偏见或不准确信息,请谨慎使用并自行验证。
107
 
108
  ---
109
 
110
  ## 授权协议
111
 
112
- 本模型基于 Google Gemma 4 构建,遵循 Gemma 模型的相关许可协议。请在使用前仔细阅读并遵守相关条款。
113
 
114
  ---
115
 
116
  ## 致谢
117
 
118
- - [Google Gemma](https://ai.google.dev/gemma)
119
  - [Unsloth](https://unsloth.ai/)
120
  - [llama.cpp](https://github.com/ggerganov/llama.cpp)
 
1
  ---
2
  language: zh
3
+ license: other
 
4
  tags:
 
 
5
  - multimodal
6
  - vision
7
  - audio
 
12
  pipeline_tag: image-text-to-text
13
  ---
14
 
15
+ # 白虎-v2
16
 
17
+ 白虎-v2 是一款多模态大语言模型,支持文本、图像、音频与视频输入,适用于中文场景下的多模态理解与生成任务。
18
 
19
  ---
20
 
21
  ## 模型简介
22
 
23
+ - **模型名称**: 白虎-v2
 
24
  - **架构**: `Gemma4ForConditionalGeneration`
25
  - **上下文长度**: 131,072 tokens
26
  - **词表大小**: 262,144
27
  - **数据类型**: float16
28
  - **支持模态**: 文本 / 图像 / 音频 / 视频
29
 
30
+ 白虎-v2 在多模态能力基础上进行了继续训练/微调,保留了对图像、音频、视频的理解能力,同时针对中文任务进行了优化。
31
 
32
  ---
33
 
 
35
 
36
  | 文件 | 说明 |
37
  |------|------|
38
+ | `白虎-v2.Q4_K_M.gguf` | 主模型 GGUF 量化版本(Q4_K_M),适合本地 CPU/GPU 推理 |
39
+ | `白虎-v2.F16-mmproj.gguf` | 多模态投影层(mmproj)FP16 版本,配合主模型用于图像/音频/视频理解 |
40
  | `Modelfile` | llama.cpp / Ollama 的模型配置文件示例 |
41
 
42
+ > 推荐搭配使用:`白虎-v2.Q4_K_M.gguf` + `白虎-v2.F16-mmproj.gguf`
43
 
44
  ---
45
 
 
49
  - 图像描述与视觉问答
50
  - 音频内容理解
51
  - 视频内容理解
52
+ - 工具调用
53
 
54
  ---
55
 
 
60
  参考仓库中的 `Modelfile` 创建 Ollama 模型:
61
 
62
  ```bash
63
+ ollama create 白虎-v2 -f Modelfile
64
+ ollama run 白虎-v2
65
  ```
66
 
67
  ### 使用 llama.cpp 命令行
68
 
69
  ```bash
70
  ./llama-cli \
71
+ -m 白虎-v2.Q4_K_M.gguf \
72
+ --mmproj 白虎-v2.F16-mmproj.gguf \
73
  --image example.jpg \
74
  -p "请描述这张图片:"
75
  ```
 
82
 
83
  ## 模型配置
84
 
85
+ - **文本模型**: 35 层,隐藏维度 1536,8 头注意力
86
+ - **视觉编码器**: 16 层,隐藏维度 768,图像 token 数 280
87
+ - **音频编码器**: 12 层,隐藏维度 1024
88
  - **视频**: 支持 32 帧采样,每帧最大 70 个 soft token
89
 
90
  ---
 
99
 
100
  ## 免责声明
101
 
102
+ 本模型生成的内容可能受训练数据影响。请勿将模型输出作为专业建议(医疗、法律、金融等)使用。模型可能存在幻觉、偏见或不准确信息,请谨慎使用并自行验证。
103
 
104
  ---
105
 
106
  ## 授权协议
107
 
108
+ 使用本模型前仔细阅读并遵守相关许可协议条款。
109
 
110
  ---
111
 
112
  ## 致谢
113
 
 
114
  - [Unsloth](https://unsloth.ai/)
115
  - [llama.cpp](https://github.com/ggerganov/llama.cpp)