- gdn2-audit —— GDN2 研究过程权重审计归档
- ⚠️ 请先读这一段
- 仓库构成一览
- 文件族逐个说明
- 1.
release_step50000.pt—— 50k 步全量微调 - 2.
graft_*—— GDN2 改造与发布嫁接 - 3.
b_*—— B 阶段 GDN2 改造 - 4.
loop2*—— K=2 循环腿(三阶段) - 5.
chains_*—— 多跳判决矩阵的各实验臂(A–G 臂) - 6.
world3d*—— world3d 槽位空间模块与联合版 - 7.
spatial*—— 合成遮挡榜上的空间模块(spatial3a / 2.5D) - 8.
xview_*—— 跨视角榜各臂 / v3 与 v3.1 主干 - 9.
sat_*—— 饱和长训完全体及其变体 - 10.
planc*—— Plan C 合体完全体 - 11.
planc_math*—— Plan D 数学修复抛光 - 12.
plane*—— v4.1「plane 完全体」 - 13.
slow_*—— 「慢区(slow-region)」离线知识库路线(10 个文件) - 14.
compressor_*与hf_*_compressor—— A 阶段视觉压缩器探索 - 15.
polish2_*—— 照片域抛光 v2 - 16.
b_*/c_adapter/token_adapter_*—— 早期探索与废弃方案(含被定罪的 adapter) - 17.
lora_ctrl.pt—— MMLU 等参量对照臂 - 18.
ximg_tags.pt—— 跨图工作区「源标记」臂
- 1.
- 体积档位(便于快速定位)
- 作者已记录的失败与被推翻结论(判断检查点用途时必须知道)
- 未说明 / 需作者补充的清单
- 溯源与其局限(重要)
- 推荐的使用方式
- 引用
- 许可
- ⚠️ 请先读这一段
gdn2-audit —— GDN2 研究过程权重审计归档
English. This is a research weight-audit archive from a vision-language project built on Qwen3.5-0.8B (a GDN2 inner-layer swap, a recurrent K=2 leg, and a spatial module). It holds 84 PyTorch/LFS checkpoint files totalling ~39.8 GB, spanning many different experiments and many intermediate training steps, including failed configurations and conclusions that the author later reversed. It is not a single deployable model: there is no config.json, no tokenizer or processor, and nothing here is loadable via from_pretrained. The repository ships no license and no release-grade model card — the rest of this card is Chinese-first and groups the files by experiment family.
本卡片的所有结论均取自本仓库内自带的文本文件(
README.md、BENCHMARKS.md、results.jsonl)。仓库内没有任何.py训练/评测脚本,因此家族归属只能靠「文件名规律 + 作者原文」判断;凡是两者都推不出来的,本卡片一律写「未说明,需作者补充」,不做推测。
⚠️ 请先读这一段
- 这是实验留档,不是模型发布。 仓库约 39.8 GB / 88 个文件,其中 84 个是大权重文件(
.pt/.safetensors,均由.gitattributes声明走 LFS)。剩下 4 个是文本文件:.gitattributes、README.md、BENCHMARKS.md、results.jsonl。 - 其中包含大量中间检查点:多个实验都留下了
*_step2000/4000/6000/8000之类的半程权重,同一个实验族的完全体与中间态混放在一起,还有明确的失败配置(见「作者已记录的失败与被推翻结论」一节)。 - 不能直接加载。 无
config.json、无 tokenizer、无 processor、无model.safetensors标准命名的权重集合。要把它当作可推理模型使用,必须先自行确定权重结构与加载代码 —— 而加载代码不在本仓库内。 - 许可:Apache License 2.0。 本仓库已随附许可全文(根目录
LICENSE,11,343 字节原文)。权重出自Qwen3.5-0.8B-GDN2研究线,其上游Qwen/Qwen3.5-0.8B官方标为apache-2.0。详见文末「许可」一节。 - 体积最大的几个文件:
release_step50000.pt(1.75 GB)、loop2p3.pt(1.22 GB),其余多数为 605–725 MB 一档。 - 官方发布模型不在本仓库。作者自述正式模型为
tysgydk/Qwen3.5-0.8B-GDN2(线上 v2)、tysgydk/Qwen3.5-0.8B-GDN2-Spatial(线上 v3.1)、tysgydk/Qwen3.5-0.8B-GDN2-LoopSpatial(线上 v4)。
仓库构成一览
体积按 1 MB = 10⁶ B 计,取 API 上报字节数换算。
| 文件族(前缀) | 文件数 | 体积 | 一句话定位 |
|---|---|---|---|
loop2* |
13 | 8.92 GB | K=2 循环腿三阶段(p1→p2→p3)及其 step 中间点 |
sat_* |
8 | 5.71 GB | 饱和长训完全体(K=2 闭环 + 空间 + 格式免疫)及其嫁接/照片抛光变体 |
plane* |
6 | 4.35 GB | v4.1「plane 完全体」(K=2 闭环 + 联合) |
chains_* |
6 | 4.27 GB | 多跳判决矩阵的各实验臂(A–G 臂) |
planc* |
5 | 3.63 GB | Plan C 合体完全体(含 K=2 闭环 + 联合 + 照片进配比) |
xview_* |
5 | 3.61 GB | 跨视角榜各臂 / v3 与 v3.1 主干 |
release_step50000.pt |
1 | 1.75 GB | 50k 步全量微调(full-FT)检查点 |
planc_math* |
2 | 1.45 GB | Plan D 数学修复抛光 |
world3d* |
4 | 1.42 GB | world3d 槽位空间模块与联合版 |
polish2_* |
4 | 1.24 GB | 照片域抛光 v2(gates + adapter) |
graft_* |
3 | 1.24 GB | GDN2 改造与发布嫁接 |
b_* |
3 | 1.21 GB | B 阶段 GDN2 改造(gates / all 两档) |
slow_* |
10 | 0.75 GB | 「慢区(slow-region)」离线知识库路线探针组 |
compressor_* + hf_*_compressor |
6 | 0.15 GB | A 阶段视觉压缩器探索 |
spatial* |
4 | 0.04 GB | 合成遮挡榜上的空间模块(spatial3a / 2.5D) |
ximg_tags.pt |
1 | 0.02 GB | 跨图工作区「源标记」臂 |
c_adapter.pt |
1 | 0.02 GB | C 阶段 adapter(后被作者判定为掉分元凶) |
lora_ctrl.pt |
1 | 0.01 GB | MMLU 等参量 LoRA 对照臂 |
token_adapter_a.pt |
1 | 0.004 GB | 早期 token adapter(作者列为废弃方案) |
| 合计 | 84 | 39.79 GB | 另有 4 个文本文件 |
文件族逐个说明
以下每族先给「这是什么阶段的产物」,再列表。表格中「依据」一列写明判断来自哪句原文或哪条记录。
1. release_step50000.pt —— 50k 步全量微调
单文件 1.75 GB,是全仓库最大的权重。作者文档把它记作 50k 步全量微调(full-FT) 的检查点,并在 TextVQA 上给出 23%(被称为崩盘)、MMLU 44.5、lang96 1.771。它的体积比同族其它 605–725 MB 文件大约 1 GB,多出的内容是什么,仓库文本未说明。
| 文件 | 体积 | 依据 |
|---|---|---|
release_step50000.pt |
1747 MB | BENCHMARKS.md TextVQA 表「50k 全量微调 (release_step50k)」;results.jsonl 中 checkpoint 写作 release_step50k (full-FT) |
注:
BENCHMARKS.md里的 checkpoint 名写作release_step50k,仓库实际文件名是release_step50000,二者应指同一条训练(步数与数值一致),但文件名的精确对应关系作者未明写。
2. graft_* —— GDN2 改造与发布嫁接
作者自述:graft_* 是「GDN2 改造与发布嫁接」,其中 graft_gates_50k 就是线上 v2 的源权重。这是理解整个仓库的起点:先把 GDN2 内层嫁接到冻结的原版主干上,得到 v2;再往下叠加空间模块与循环腿。
| 文件 | 体积 | 用途(作者原文/记录) |
|---|---|---|
graft_gates_50k.pt |
605 MB | 线上 v2 源权重(= gates-only);TextVQA val[512] 63.3/73.6,MMLU 45.2,lang96 1.776 |
graft_release.pt |
622 MB | 初版嫁接(带 adapter);TextVQA val[512] 52.1/61.7 |
graft_adapter_50k.pt |
16.8 MB | 50k 阶段配套的 adapter 权重(体积远小于主干,属附加模块) |
3. b_* —— B 阶段 GDN2 改造
注意一处作者文档内部的不一致:仓库自己的 README.md 把 b_* 归入「早期探索与废弃方案」,但 BENCHMARKS.md 与 results.jsonl 明确把 b_gates / b_all 当作 B 阶段的 GDN2 改造结果并记录了具体数字。本卡片按后者归类。
| 文件 | 体积 | 用途 |
|---|---|---|
b_all.pt |
605 MB | B2 阶段(标注 GDN2+B);TextVQA 62.0,MMLU 44.7,lang96 1.8880 |
b_gates.pt |
302 MB | 「B 后」的 gates 档;lang96 1.9530 |
b_gates_smoke.pt |
302 MB | smoke 变体。具体用途未说明,需作者补充 |
4. loop2* —— K=2 循环腿(三阶段)
作者自述循环腿为三阶段:**loop2p1(对应 loop2long)→ loop2p2 → loop2p3**。这是全仓库体积最大的一个族(8.92 GB)。loop2p3 是最强的正向循环结果所在:GSM8K K=1 36.5 → K=2 43.0(配对复测 35.0 vs 43.8,McNemar p=0.0010);但同时它在 TextVQA 上出现严重终止漂移(exact 仅 8.4 / soft 65.8)。
| 文件 | 体积 | 用途 |
|---|---|---|
loop2long.pt |
605 MB | loop2p1 阶段(作者记「loop2p1 (loop2long, 10k)」),lang96 2.119 |
loop2long_step2000/4000/6000/8000.pt |
各 605 MB | loop2p1 的 4 个训练中间点 |
loop2p2.pt |
693 MB | 阶段二「解冻注意力续训 10k」,lang96 1.992 |
loop2p2_step2000/4000/6000/8000.pt |
各 693 MB | 阶段二的 4 个中间点;作者 §6 记录仅存 step2000=2.014 / step4000=1.997 两个插针 |
loop2p3.pt |
1222 MB | 阶段三「全解冻续训 10k」;GSM8K K=2 43.0(配对 43.8) |
loop2.pt |
605 MB | 与 p1/p2/p3 的对应关系未说明,需作者补充 |
loop2_smoke.pt |
605 MB | smoke 变体。用途未说明,需作者补充(README.md 提到它「已归档在早期提交中」,但文件实际存在于本仓库) |
观察:
loop2p3.pt(1.22 GB)比同族其它文件大约 0.5–0.6 GB,loop2p2*(693 MB)又比loop2long*/loop2*(605 MB)大一档。体积差异的原因仓库文本未说明。
5. chains_* —— 多跳判决矩阵的各实验臂(A–G 臂)
这是本仓库里归属最确定的一族,因为 results.jsonl 的 checkpoint 字段直接写了臂名(A/B/C/D/E/F/G、C2 fair、D2)。场景是 chains_eval(n=800,高密度 6–8 物体、2hop/3hop 遮挡链)。
| 文件 | 体积 | 臂与配置(results.jsonl 原文标注) |
|---|---|---|
chains_k1.pt |
702 MB | A 臂:K=1 链上训(无钩) |
chains_k2.pt |
702 MB | C 臂:K=2 链上训(半数据 + 瘸腿起点,作者后判定该设置不公平) |
chains_k2fair.pt |
702 MB | C2 臂:公平复赛(K=2 修腿 + 等量数据) |
chains_k1_multi.pt |
721 MB | E 臂:K=1 多层注入(作者认定的「带宽 +14 实锤」) |
chains_k2_multi.pt |
721 MB | F 臂:K=2 多层完全体 |
chains_k2_closed.pt |
725 MB | G 臂:K=2 闭环多层 |
为什么没有 *_hook 文件? 作者记录 B / D / D2 臂(即 A、C、C2 各加空间钩)的对照是在同一份权重上做钩子开/关的同权重消融,因此仓库里没有单独的 hook 权重文件。
6. world3d* —— world3d 槽位空间模块与联合版
| 文件 | 体积 | 用途 |
|---|---|---|
world3d.pt |
9 MB | world3d v1 槽位 world-xyz 模块(作者记 v1 未加前景掩码、有背景反投影污染) |
world3d_v2.pt |
9 MB | world3d v2(前景掩码 + 有效槽位过滤) |
world3d_joint.pt |
702 MB | 联合版(主干与空间模块一起训);作者判定此时 QA loss 把任务教给了主干 2D 通路,空间模块边际≈0 |
world3d_joint_step2500.pt |
702 MB | 联合版的 2500 步中间点。该中间点的具体评测结果未说明 |
观察:两个 9 MB 文件是「只有空间模块」的权重,702 MB 的两个是「主干 + 模块」的联合检查点;这是从体积与作者对联合版的描述作出的观察,仓库未逐条说明文件内含哪些张量。
7. spatial* —— 合成遮挡榜上的空间模块(spatial3a / 2.5D)
均为 9 MB 左右,属「挂到冻结 K=1 发布版上的模块权重」。作者描述模块结构为 SpatialSlots 32×512 + 零初始化门控的 GatedSpatialRead。
| 文件 | 体积 | 用途 |
|---|---|---|
spatial3a.pt |
9 MB | spatial3a 训练 3000 步的模块;occlusion3a 榜 occlude 12→33、hidden 7→40、count_hidden 30→63 |
spatial3a_10k.pt |
9 MB | 同族 10k 步版本 |
spatial25d.pt |
9 MB | 2.5D v1:逐 patch 深度监督;作者记深度头崩溃、ridge 探针 R² 全负 |
spatial25d_v2.pt |
9 MB | 2.5D v2:槽位级 xyz 监督;R² x/y/z = 0.978 / 0.970 / 0.005(z 不可解码) |
8. xview_* —— 跨视角榜各臂 / v3 与 v3.1 主干
场景为 world3d_xview(hide-mode 定向遮挡,第一视角完全看不到目标)。作者自述 xview_k1 = H 臂 = v3 主干,xview_k2c = I 臂(K=2 闭环),xview_k1_mc3 = 线上 v3.1 源权重。跨视角隐藏物体题从 12 → 76(作者称为「+64 能力跃迁」)。
| 文件 | 体积 | 用途 |
|---|---|---|
xview_k1.pt |
721 MB | H 臂 / v3 主干;TextVQA val[512] 63.5/74.0,BLINK TOTAL 42.1 |
xview_k2c.pt |
725 MB | I 臂:K=2 闭环;BLINK TOTAL 43.1 |
xview_k1_mc.pt |
721 MB | 「v3.1 中间版」(results.jsonl 记 TextVQA 63.7/74.2) |
xview_k1_mc3.pt |
721 MB | v3.1 正式版 / 线上 v3.1 源权重;TextVQA 63.7/74.0,BLINK TOTAL 46.0 |
xview_k1_mc2.pt |
721 MB | mc2 在作者文档中未出现。它是 mc 与 mc3 之间的哪一档、为何保留,未说明,需作者补充 |
9. sat_* —— 饱和长训完全体及其变体
作者定位:「饱和长训完全体(K=2 闭环 + 空间 + 格式免疫)」及其嫁接/拍照变体。BLINK TOTAL 46.3,TextVQA K=2 模式 47.9、K=1 模式 53.3。作者明确记录了「sat 甜区不存在」(未发现存在最优中间步)。
| 文件 | 体积 | 用途 |
|---|---|---|
sat_k2c.pt |
725 MB | 饱和长训完全体(K=2 闭环);BLINK TOTAL 46.3 |
sat_k2c_step2000.pt |
725 MB | 中间点;TextVQA 49.2/70.1 |
sat_k2c_step4000.pt |
725 MB | 中间点;TextVQA 47.5/68.6 |
sat_k2c_step6000.pt |
725 MB | 中间点。step6000 没有任何评测记录,未说明 |
sat_k2c_step8000.pt |
725 MB | 中间点;TextVQA K=2 47.9/69.1、K=1 模式 53.3/72.5 |
sat_k2c_photo.pt |
725 MB | 「+照片抛光」变体之一 |
sat_k1_photo.pt |
721 MB | 「+照片抛光」变体之一 |
sat_k2c_graft.pt |
637 MB | 作者在 README.md 中记为「嫁接变体」。嫁接了什么、得到什么结果,未说明 |
作者记录了两个照片抛光结果:
sat_k2c + photo polish v1=44.5/68.9,sat + photo polish v2 (K=1)=50.8/72.9。但哪份结果对应sat_k1_photo.pt、哪份对应sat_k2c_photo.pt,仓库文本没有明写,需作者补充。
10. planc* —— Plan C 合体完全体
作者定位:K=2 闭环 + 联合 + 照片进配比。这是本族里成绩最亮也最矛盾的一条:K=1 TextVQA 63.9(作者记为「历史最好」)、BLINK 55.8(并列纪录),但 GSM8K 倒挂到 30.5(K=2 仅 21.5)。
| 文件 | 体积 | 用途 |
|---|---|---|
planc.pt |
725 MB | Plan C 完全体(作者记 K=1 TextVQA 63.9/73.6、BLINK 55.8) |
planc_step2000/4000/6000/8000.pt |
各 725 MB | 4 个训练中间点。哪个是终值、各 step 的单独成绩,均未说明 |
11. planc_math* —— Plan D 数学修复抛光
作者定位:把 GSM8K-CoT 放进配比的数学修复抛光。结果是把数学救回 36.0,但 TextVQA exact 崩到 49.8(作者归因于「终止边界污染」)。planc_math_step1000 被作者明确标为 GSM8K 40.0 的半程点。
| 文件 | 体积 | 用途 |
|---|---|---|
planc_math.pt |
725 MB | Plan D 抛光完全体;GSM8K K1/K2 36.0/32.5,TextVQA K1 49.8/72.5 |
planc_math_step1000.pt |
725 MB | 作者明写的半程点(GSM8K 40.0/34.5) |
12. plane* —— v4.1「plane 完全体」
作者定位:v4 / v4.1 = 循环 + 空间(嫁接 LoopSpatial / plane 完全体)。这条线出了首次 K2 ≥ K1 的 GSM8K 结果(38.5 / 39.0),BLINK 55.3,TextVQA K=1 58.4(加 stop-at-newline 解码后回到 63.7)。
| 文件 | 体积 | 用途 |
|---|---|---|
plane.pt |
725 MB | plane 完全体;GSM8K K1/K2 38.5/39.0,BLINK 55.3 |
plane_step2000/4000/6000/8000/10000.pt |
各 725 MB | 5 个训练中间点。**plane.pt 与 plane_step10000.pt 是否为同一终值、各 step 成绩如何,未说明** |
13. slow_* —— 「慢区(slow-region)」离线知识库路线(10 个文件)
注意:README.md 的家族清单里没有列这一族,它只出现在 BENCHMARKS.md §2.11。 作者的研究结论是「慢区封存」:该路线的增益上限约 +1 MMLU 分,且两次 LAZY 判决被查明是评测脚本 bug。这一族同时混用 .safetensors 与 .pt 两种后缀。
| 文件 | 体积 | 用途 |
|---|---|---|
slow_v0.safetensors |
16.8 MB | 慢区模块 v0;用作注入门控扫描的验收对象(v2 + slow_v0) |
slow_v1.safetensors |
8.4 MB | 慢区模块 v1(gate 焊死 0.02,2k 步;判决 Δ=+0.0000) |
slow_v1b.safetensors |
8.4 MB | v1b 与 v1 的区别未说明,需作者补充 |
slow_v2.safetensors |
8.4 MB | 慢区模块 v2(10k 步,门控课程 0.02→0.1;效应量饱和,Δ≈-0.003) |
slow_v3.safetensors |
8.4 MB | 慢区模块 v3(联合解冻档) |
slow_v1/v1b/v2/v3.reads.pt |
各 0.5 MB | 「读取器(reader)」权重;results.jsonl 有 checkpoint 名 v2 + slow_v2 reader,用于「新事实注入」探针 |
slow_v3.backbone.pt |
693 MB | 联合解冻主干权重(693 MB,与 loop2p2* 同档) |
观察:
.reads.pt体积仅 0.5 MB,与作者描述的「训练读取器 / 随机读取器」小型读取器一致;但仓库文本并未逐条说明这些后缀各自装什么,属观察而非作者说明。
14. compressor_* 与 hf_*_compressor —— A 阶段视觉压缩器探索
作者把 compressor_* 归入「早期探索与废弃方案」。hf_grid_compressor 有明确记录(A 阶段 grid compressor @256×256,TextVQA 仅 12.0,MM40 39/40);其余五个同族文件只从文件名可看出是「A 阶段压缩器」的不同实现路径,彼此差别未说明。
| 文件 | 体积 | 用途 |
|---|---|---|
hf_grid_compressor.pt |
16.8 MB | A 阶段 grid compressor @256²;TextVQA 12.0,MM40 39/40 |
hf_native_compressor.pt |
25.3 MB | 同族变体,与下面两项的区别未说明 |
hf_official_path_compressor.pt |
25.3 MB | 同族变体,区别未说明 |
compressor_a_through_lm.pt |
27.4 MB | 「through_lm」的含义未说明 |
compressor_a_aux.pt |
27.4 MB | 「aux」的含义未说明 |
compressor_a_smoke.pt |
26.9 MB | smoke 变体,用途未说明 |
15. polish2_* —— 照片域抛光 v2
作者记 polish2 为「3000 步真照片」的照片域抛光,并给出 step1000/2000/3000 的 MMLU(43.9 / 44.6 / 44.4)与 step2000/3000 的 TextVQA(52.9/62.3、52.7/62.1)。
| 文件 | 体积 | 用途 |
|---|---|---|
polish2_gates.pt |
605 MB | 抛光后的主干/gates 权重 |
polish2_adapter.pt |
16.8 MB | 配套 adapter |
polish2_smoke_gates.pt |
605 MB | smoke 版本的主干/gates。与正式版的差别未说明 |
polish2_smoke_adapter.pt |
16.8 MB | smoke 版本的 adapter,差别未说明 |
注:文件只有「一档」权重,没有
polish2_step1000/2000/3000三个中间点文件,保存的是哪一步未说明。
16. b_* / c_adapter / token_adapter_* —— 早期探索与废弃方案(含被定罪的 adapter)
作者在 README.md 中把 compressor_* / token_adapter_* / polish2_* / b_* / c_adapter 一并归为「早期探索与废弃方案」(其中 b_* 见第 3 节的口径分歧)。这里补上单个文件:
| 文件 | 体积 | 用途 |
|---|---|---|
c_adapter.pt |
16.8 MB | C 阶段 adapter(TextVQA 47.0)。作者在 BENCHMARKS.md §5 把它判定为「TextVQA -11 的唯一元凶」——零初始化 adapter 并不等价于恒等映射(LN(x)≠x)。这是理解后续所有「gates-only」路线的关键文件 |
token_adapter_a.pt |
4.2 MB | 早期 token adapter,具体用途与是否被废弃的原因,仓库文本未逐条说明 |
17. lora_ctrl.pt —— MMLU 等参量对照臂
9.2 MB。作者用它做 LoRA r=25(4.61M 参数)等参量对照:与慢区模块参数量相当、同数据同步数同配方,结果 MMLU 39.30,而基线是 45.20。作者据此论证慢区的 +1.2 不是「参数安慰剂」。
18. ximg_tags.pt —— 跨图工作区「源标记」臂
22.0 MB。对应 BENCHMARKS.md §2.12 的 C 臂(源标记,source-tagged),用双图输入 + 选项字母 logprob 判分(不生成)。作者记录源标记把空间模块从 -6.3(帮倒忙)翻到 +13.3(正贡献)。
体积档位(便于快速定位)
这是从 API 上报字节数得到的观察,不是作者说明:
- 1.2–1.75 GB:
release_step50000.pt(1747 MB)、loop2p3.pt(1222 MB)—— 两个异常大的文件。 - 702–725 MB:循环腿 p2/p3、chains 全族、plane / planc / planc_math / sat / xview 全族、
world3d_joint*、slow_v3.backbone.pt。仓库中绝大多数「完全体」检查点都在这一档。 - 605–637 MB:
graft_*、b_all、loop2*(p1 与 loop2)、polish2_*_gates、部分sat_*。 - 302 MB:
b_gates.pt、b_gates_smoke.pt(B 阶段 gates 档,约为 605 MB 档的一半)。 - 9–27 MB:各空间模块(
world3d、spatial*)、压缩器(hf_*、compressor_*)、ximg_tags、slow_v0。 - 0.5–17 MB:adapter / 读取器 / LoRA 对照等附加模块。
作者已记录的失败与被推翻结论(判断检查点用途时必须知道)
BENCHMARKS.md 的价值恰在于它把负结果和翻案都记下来了。以下几条会直接影响你怎么看某个检查点:
- 「嫁接保住了 VQA」是口径假象(val[:200] 与 val[512] 不一致);同协议头对头后实为
63.1vs52.0。 - 50k 全量微调(
release_step50000.pt)在真实照片上是崩盘的(23%),且新模型作者后续也不推荐直接用。 c_adapter被定罪(零初始化 adapter 非恒等),gates-only 才是 v2 的正式形态。- 第一版四臂「循环帮倒忙」的结论已被公平复赛推翻(C/D 臂当时数据减半 + 起点瘸腿)。
- 免训练阻尼循环(K=3)在混合线性注意力模型上失效(GSM8K -13,掉到
23.5)。 - 慢区路线封存,增益约 +1 MMLU。
loop2p3的 TextVQA8.4是终止边界伪影,不是知识丢失。
未说明 / 需作者补充的清单
以下条目在本仓库全部文本(含 README.md、BENCHMARKS.md、results.jsonl、.gitattributes)中找不到依据,本卡片不做推测:
loop2.pt与loop2p1/p2/p3的对应关系;**loop2_smoke.pt** 的用途。xview_k1_mc2.pt—— 作者文档只提到mc与mc3,mc2完全没有出现。slow_v1b.*与slow_v1.*的区别;slow_*为何混用.safetensors/.pt两种后缀。sat_k2c_graft.pt嫁接的具体内容与结果。sat_k1_photo.pt与sat_k2c_photo.pt分别对应作者记录中的哪个「照片抛光」结果。sat_k2c_step6000.pt—— 没有对应的评测记录。chain之外各族的*_step*:planc/plane/loop2long/loop2p2的中间点里,哪个是终值、以及plane.pt与plane_step10000.pt的关系。world3d_joint_step2500.pt这个中间点的成绩。hf_native_compressor.pt/hf_official_path_compressor.pt与hf_grid_compressor.pt的三者差别;**compressor_a_aux.pt/compressor_a_through_lm.pt** 命名的含义。token_adapter_a.pt的具体用途。- 各文件内部到底装了哪些张量(是「只有模块」还是「主干+模块」):体积只能给提示,仓库没有索引文件、没有
config.json、也没有说明。 - 规模信息全部缺失:参数量、训练数据规模、训练总步数(除
*_step*文件名暗示的步数)、硬件以外的细节,仓库文本均未给出。 release_step50000.pt为何比其他检查点大约 1 GB(是否含优化器状态等)未说明。b_*的家族归属:README.md说属「早期探索与废弃方案」,BENCHMARKS.md说属 B 阶段 GDN2 改造 —— 两处口径冲突,需作者定夺。
溯源与其局限(重要)
- 本仓库内没有任何可运行的训练或评测脚本,也没有被引用的数据文件。
BENCHMARKS.md引用的权威记录是/root/autodl-tmp/vlm_gdn2/PROGRESS.md(724 行)与outputs/*.log(100+ 份日志),这些文件都不在本仓库,因此本卡片无法独立复核其中的任何数字。BENCHMARKS.md自己声明:部分早期阶段(A/B/C 阶段)的原始日志已在磁盘清理中丢失,相关数字仅以 PROGRESS 为唯一来源;另记录了 9 条评测事故(含两次因脚本 bug 导致的假判决、一次生成器种子导致的训练/评测数据泄漏)。- 因此,本卡片中的一切数值都只是转录自作者自己的文档,未经独立复现,请按「作者自述的研究过程记录」对待。
推荐的使用方式
- 想理解项目脉络:先读
BENCHMARKS.md(448 行,含中英双语总结与完整时间线),再用本卡片的家族表定位具体文件。 - 想复现某个结论:本仓库只提供权重,不提供加载代码与评测脚本,需要自己去作者的正式模型仓库或联系作者索取。
- 想直接部署:请改用作者列出的三个正式发布仓库,不要用本仓库的检查点。
引用
- 魔搭(ModelScope):
https://modelscope.cn/models/tysgydk/gdn2-audit - Hugging Face:
- 作者相关正式模型(作者
README.md中列出,均为魔搭路径):tysgydk/Qwen3.5-0.8B-GDN2(线上 v2)tysgydk/Qwen3.5-0.8B-GDN2-Spatial(线上 v3.1)tysgydk/Qwen3.5-0.8B-GDN2-LoopSpatial(线上 v4)
许可
Apache License 2.0。 本仓库的全部权重都出自 Qwen3.5-0.8B-GDN2 研究线,其上游为 Qwen/Qwen3.5-0.8B,官方 model card 标为 apache-2.0(已核实)。作者已确认按 Apache-2.0 开源,故 front matter 写 license: apache-2.0。
说明:本仓库已随附 Apache-2.0 许可全文(根目录 LICENSE,11,343 字节,取自上游官方仓库原文,未作任何改动)。版权署名:Copyright 2026 我本是我沐(ModelScope @tysgydk / Hugging Face @tysgydke)。
另请注意这是实验留档——其中不少检查点对应作者本人后来推翻的结论与失败配置,许可开放不等于其中每个权重都值得使用。
本卡片由仓库内文本文件(README.md、BENCHMARKS.md、results.jsonl)与文件清单(API 上报的路径 / 字节数 / LFS 属性)整理而成,未读取任何权重内容。文件体积按 1 MB = 10⁶ B 换算。