FireRedPunc-ONNX / README_zh.md
zhipingYang's picture
mirror FireRedPunc-ONNX from ModelScope(逐字节一致)+ 中英双语模型卡
7b8216b verified
|
Raw
History Blame Contribute Delete
7.08 kB
metadata
license: apache-2.0
language:
  - zh
  - en
tags:
  - punctuation
  - onnx
  - bert
  - asr
frameworks:
  - onnx

FireRedPunc · 全本地中英文自动标点

License: Apache 2.0 Runs Local Platform

给一段没有标点的语音转写文字,本模型自动补上标点(中文逗号、句号、问号、感叹号;英文 , . ? ! 及首字母大写)——让机器转出来的「一大段没断句的文字」变成通顺可读的句子。全部在你自己的电脑上完成,不上云、免费、私密

模型由小红书 FireRedTeam研发、以 Apache-2.0 开源(FireRedPunc,基于中文 BERT 的标点预测模型)。本仓不是新模型:模型能力归 FireRedTeam;我们(活水 AI 实验室)把它的原始权重转换成可离线运行的量化 ONNX 文件(int8)并做了质量校验,纳入活水模型引擎的转录高配——我们做的是「让它在你电脑上开箱即用」。

一、它解决什么问题

语音识别(ASR)出来的文字,很多模型不带标点——一整段话没有逗号句号,读起来费劲、也不好做字幕、摘要、检索。给转写结果自动加标点,是把「能听懂的机器文字」变成「能读的人类文字」的关键一步,但好用的中文标点模型常有两道坎:

  • 中英混排:中文用全角「,。?!」、英文用半角「, . ? !」且句首要大写——规则不同,很多模型只顾一头;
  • 要不要上云:转写内容常涉及隐私(会议、采访、备忘),再传一次到别人的服务器加标点并不放心。

本模型两样都顾到:中英文都准完全本地。转写高配「一站式」里转写完就顺手加好标点,全程不出你的电脑。

二、它是怎么做到的

模型能力来自 FireRedTeam 的 FireRedPunc——一个基于中文 BERT(chinese-lert-base 底座)的序列标注模型:把转写文字逐字读一遍,判断每个字/词后面该不该加标点、加哪个。它是 FireRedASR2 系列「一站式 ASR 系统」里的标点模块。

我们做的:把 FireRedTeam 开源的 PyTorch 权重转换成一个 int8 量化的 ONNX 文件(约 102 MB,从原始 388 MB 大幅压缩),让它在普通 CPU 上就能流畅运行、无需显卡;并在活水模型引擎里端到端复核了输出(见下节);许可沿用上游 Apache-2.0 不变。跨 macOS / Windows / Linux 本地运行。

三、效果如何

模型本体的完整评测以 FireRedTeam 官方报告为准技术报告)。官方数据显示 FireRedPunc 在中英文标点预测上表现领先:

FireRedTeam 官方报告 FireRedPunc
中英文标点平均 F1(越高越好) **78.90%**,领先 FunASR-Punc(62.77%)

我们自己的复核(活水模型引擎,纯 CPU):

我们校验的项目 结果
量化保真(int8 ONNX vs 官方全精度 PyTorch,逐值比对同一批文本) 输出逐字一致(中文、英文、中英混说样本均通过)
运行设备 无需显卡,普通 CPU 即可

也就是说:把这套本地部署档接进我们的引擎后,加标点结果与上游全精度模型逐字相同——量化没有带来可见的质量损失。

四、局限与下一步

  • 标点是「预测」不是「规定」:模型按语料统计给出最可能的断句,偶有与人的习惯不同的地方(尤其口语化、超长句、专业术语密集时);识别文本本身以主转写为准,标点在其上叠加。
  • 专为转写文字设计:输入是 ASR 转写的连续文字,不是任意书面文本;对已带标点或格式化文本效果非其所长。
  • 随转写高配一起用:本模型不单独下载使用,而是作为活水模型「智能转录」高配的一部分,转写完自动加标点(可在设置里开关)。

五、怎么下载与使用

本模型专为 活水模型(42model) 打包,随「转录高配」一起获取:

桌面版:在「模型库」→「智能转录」里下载高配 FireRedASR2-AED(含标点),转录时在参数里开「标点」即可。

文件与许可

文件 作用
punc.int8.onnx 标点预测模型(int8 量化 BERT)
tokenizer.json 中文 BERT 分词器(WordPiece)
out_dict 标点类别表(无标点 / ,。?! 五类)

各文件 sha256 见仓库文件页,可自行校验。

许可:模型本体为 FireRedPunc,© 小红书 FireRedTeam,Apache-2.0(官方源:GitHub · ModelScope)。本仓为其转换的 int8 ONNX 本地部署档,同样遵循 Apache-2.0,使用即表示同意上游许可条款。

引用

模型本体请引用上游 FireRedTeam:

@article{xu2026fireredasr2s,
  title={FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System},
  author={Xu, Kaituo and Jia, Yan and Huang, Kai and Chen, Junjie and Li, Wenpeng and Liu, Kun and Xie, Feng-Long and Tang, Xu and Hu, Yao},
  journal={arXiv preprint arXiv:2603.10420},
  year={2026}
}

本仓的 int8 ONNX 本地部署封装对你有帮助,可另附:

@misc{yang2026fireredpunconnx,
  title        = {FireRedPunc-ONNX: A Local Quantized Build of FireRedTeam's FireRedPunc},
  author       = {Yang, Zhiping},
  year         = {2026},
  howpublished = {\url{https://modelscope.cn/models/42ailab/FireRedPunc-ONNX}},
  organization = {42ailab},
  note         = {int8 ONNX 量化与本地部署封装;模型本体为 FireRedTeam FireRedPunc(Apache-2.0)。Contact: contact@42ailab.com}
}

联系我们:contact@42ailab.com

关于我们

活水 AI 实验室(42ailab) — 源自 2023 年成立的活水智能团队,致力于以认知科学为基石,推动人工智能与人类智能的深度融合与科学创新。

活水模型(42model) — 由活水 AI 实验室打造的「你的 AI 模型引擎」,致力于让 AI 能力回到你自己的设备上本地运行——翻译、转写、识别、对话、编程皆免费而私密,跨 macOS / Windows / Linux;并可借云端算力微调出专属模型,训练完成后回传本机私密运行。