| --- |
| license: apache-2.0 |
| language: |
| - zh |
| - en |
| tags: [punctuation, onnx, bert, asr] |
| frameworks: [onnx] |
| --- |
| |
| <!-- |
| 这是 ModelScope / HuggingFace 仓 `42ailab/FireRedPunc-ONNX` 的 README,随包上传。改这里 = 改仓首页。 |
| --> |
| # FireRedPunc · 全本地中英文自动标点 |
|
|
| [](https://www.apache.org/licenses/LICENSE-2.0) |
| [](https://42model.com) |
| [](https://42model.com) |
|
|
| 给一段**没有标点**的语音转写文字,本模型自动补上标点(中文逗号、句号、问号、感叹号;英文 , . ? ! 及首字母大写)——让机器转出来的「一大段没断句的文字」变成通顺可读的句子。全部在你自己的电脑上完成,**不上云、免费、私密**。 |
|
|
| > **模型由[小红书 FireRedTeam](https://github.com/FireRedTeam/FireRedASR2S)研发、以 Apache-2.0 开源**(FireRedPunc,基于中文 BERT 的标点预测模型)。**本仓不是新模型**:模型能力归 FireRedTeam;我们(活水 AI 实验室)把它的原始权重**转换成可离线运行的量化 ONNX 文件**(int8)并做了质量校验,纳入[活水模型](https://42model.com)引擎的转录高配——我们做的是「让它在你电脑上开箱即用」。 |
|
|
| ## 一、它解决什么问题 |
|
|
| 语音识别(ASR)出来的文字,很多模型**不带标点**——一整段话没有逗号句号,读起来费劲、也不好做字幕、摘要、检索。给转写结果自动加标点,是把「能听懂的机器文字」变成「能读的人类文字」的关键一步,但好用的中文标点模型常有两道坎: |
|
|
| - **中英混排**:中文用全角「,。?!」、英文用半角「, . ? !」且句首要大写——规则不同,很多模型只顾一头; |
| - **要不要上云**:转写内容常涉及隐私(会议、采访、备忘),再传一次到别人的服务器加标点并不放心。 |
|
|
| 本模型两样都顾到:**中英文都准**、**完全本地**。转写高配「一站式」里转写完就顺手加好标点,全程不出你的电脑。 |
|
|
| ## 二、它是怎么做到的 |
|
|
| **模型能力来自 FireRedTeam 的 FireRedPunc**——一个基于**中文 BERT**(chinese-lert-base 底座)的**序列标注**模型:把转写文字逐字读一遍,判断每个字/词后面该不该加标点、加哪个。它是 FireRedASR2 系列「一站式 ASR 系统」里的标点模块。 |
|
|
| **我们做的**:把 FireRedTeam 开源的 PyTorch 权重**转换成一个 int8 量化的 ONNX 文件**(约 102 MB,从原始 388 MB 大幅压缩),让它**在普通 CPU 上就能流畅运行**、无需显卡;并**在活水模型引擎里端到端复核**了输出(见下节);许可**沿用上游 Apache-2.0 不变**。跨 macOS / Windows / Linux 本地运行。 |
|
|
| ## 三、效果如何 |
|
|
| **模型本体的完整评测以 FireRedTeam 官方报告为准**([技术报告](https://github.com/FireRedTeam/FireRedASR2S))。官方数据显示 FireRedPunc 在中英文标点预测上表现领先: |
|
|
| | FireRedTeam 官方报告 | FireRedPunc | |
| |---|---| |
| | 中英文标点平均 F1(越高越好) | **78.90%**,领先 FunASR-Punc(62.77%) | |
|
|
| **我们自己的复核**(活水模型引擎,纯 CPU): |
|
|
| | 我们校验的项目 | 结果 | |
| |---|---| |
| | 量化保真(int8 ONNX vs 官方全精度 PyTorch,逐值比对同一批文本) | 输出**逐字一致**(中文、英文、中英混说样本均通过) | |
| | 运行设备 | 无需显卡,普通 CPU 即可 | |
|
|
| 也就是说:把这套本地部署档接进我们的引擎后,加标点结果与上游全精度模型**逐字相同**——量化没有带来可见的质量损失。 |
|
|
| ## 四、局限与下一步 |
|
|
| - **标点是「预测」不是「规定」**:模型按语料统计给出最可能的断句,偶有与人的习惯不同的地方(尤其口语化、超长句、专业术语密集时);识别文本本身以主转写为准,标点在其上叠加。 |
| - **专为转写文字设计**:输入是 ASR 转写的连续文字,不是任意书面文本;对已带标点或格式化文本效果非其所长。 |
| - **随转写高配一起用**:本模型不单独下载使用,而是作为[活水模型](https://42model.com)「智能转录」高配的一部分,转写完自动加标点(可在设置里开关)。 |
|
|
| ## 五、怎么下载与使用 |
|
|
| 本模型专为 [活水模型(42model)](https://42model.com) 打包,随「转录高配」一起获取: |
|
|
| **桌面版**:在「模型库」→「智能转录」里下载高配 **FireRedASR2-AED**(含标点),转录时在参数里开「标点」即可。 |
|
|
| ## 文件与许可 |
|
|
| | 文件 | 作用 | |
| |---|---| |
| | `punc.int8.onnx` | 标点预测模型(int8 量化 BERT) | |
| | `tokenizer.json` | 中文 BERT 分词器(WordPiece) | |
| | `out_dict` | 标点类别表(无标点 / ,。?! 五类) | |
|
|
| 各文件 sha256 见仓库文件页,可自行校验。 |
|
|
| **许可**:模型本体为 FireRedPunc,© 小红书 FireRedTeam,**Apache-2.0**(官方源:[GitHub](https://github.com/FireRedTeam/FireRedASR2S) · [ModelScope](https://modelscope.cn/models/xukaituo/FireRedPunc))。本仓为其转换的 int8 ONNX 本地部署档,同样遵循 [Apache-2.0](https://www.apache.org/licenses/LICENSE-2.0),使用即表示同意上游许可条款。 |
|
|
| ## 引用 |
|
|
| **模型本体**请引用上游 FireRedTeam: |
|
|
| ```bibtex |
| @article{xu2026fireredasr2s, |
| title={FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System}, |
| author={Xu, Kaituo and Jia, Yan and Huang, Kai and Chen, Junjie and Li, Wenpeng and Liu, Kun and Xie, Feng-Long and Tang, Xu and Hu, Yao}, |
| journal={arXiv preprint arXiv:2603.10420}, |
| year={2026} |
| } |
| ``` |
|
|
| 若**本仓的 int8 ONNX 本地部署封装**对你有帮助,可另附: |
|
|
| ```bibtex |
| @misc{yang2026fireredpunconnx, |
| title = {FireRedPunc-ONNX: A Local Quantized Build of FireRedTeam's FireRedPunc}, |
| author = {Yang, Zhiping}, |
| year = {2026}, |
| howpublished = {\url{https://modelscope.cn/models/42ailab/FireRedPunc-ONNX}}, |
| organization = {42ailab}, |
| note = {int8 ONNX 量化与本地部署封装;模型本体为 FireRedTeam FireRedPunc(Apache-2.0)。Contact: contact@42ailab.com} |
| } |
| ``` |
|
|
| 联系我们:**contact@42ailab.com** |
|
|
| ## 关于我们 |
|
|
| **[活水 AI 实验室(42ailab)](https://42ailab.com)** — 源自 2023 年成立的活水智能团队,致力于以认知科学为基石,推动人工智能与人类智能的深度融合与科学创新。 |
|
|
| **[活水模型(42model)](https://42model.com)** — 由活水 AI 实验室打造的「你的 AI 模型引擎」,致力于让 AI 能力回到你自己的设备上本地运行——翻译、转写、识别、对话、编程皆免费而私密,跨 macOS / Windows / Linux;并可借云端算力微调出专属模型,训练完成后回传本机私密运行。 |
|
|