大厂PPT的神话,开源界的笑话:扒一扒 openPangu 2.0 里的“史诗级硬核套壳

#2
by Adikkkk - opened

这就是所谓的“自主研发、全栈国产化”的遥遥领先吗?拼凑出这么个畸形儿,简直是开源界的史诗级大翻车!瞅瞅这 config.json 和 tokenizer_config.json,Qwen 的纯正血统都要从屏幕里溢出来了。哪怕嘴上再怎么喊着昇腾原生、MLA 创新,底下连分词器(Tokenizer)都没整明白。退一万步说,就算是为了照顾底层 CANN 或者 MindSpore 的硬编码腾位置,花几分钟用 Python 脚本重构一下词表、做个干净的映射,很难吗?居然直接在词表里塞了几百个丢人现 wedge 的 [unused] 占位符,这代码抹布水一样的胶水味,隔着网线都觉得丢人。更绝的是那个滑窗注意力(SWA),硬生生把全局注意力阉割成 1:2 的“斑马线”,底层硬塞 512 宽度的短视眼,到顶层突然蹦出个 2048 的空窗——怎么着,指望顶层靠脑补和幻觉去发明上下文啊?为了凑 512k 上下文的营销 PPT 指标,把好端端的 Transformer 矩阵概率学整成了不伦不类的随机数生成器。难怪 CL-Bench 长文本长跑直接掉裤子,拿个不显眼的 19% 挂科分。5M 大小的 model.safetensors.index.json 更是开眼界,把 384 个专家肉眼可见地用扁平循环给铺开写,这已经不是懒了,这是研发团队赶工交差的“赛博糊弄学”。这哪是 openPangu 2.0,这分明是“Qwen 3 缝合怪之 Ascend 受难记”。大厂的预算给足了, ინჟინერია(工程素养)却活活退化成了草台班子熬夜写的大作业。

Sign up or log in to comment