File size: 6,961 Bytes
0e9808f
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
# 四个仓库说明

| 仓库 | 类型 | 可见性 | 体积 | 用途 |
|---|---|---|---|---|
| [`daipath/filter-inspection`](https://huggingface.co/daipath/filter-inspection) | model | 公开 | 4.6 GB | **拿来就用**:免安装可执行文件、ONNX、权重 |
| [`daipath/filter-inspection-data`](https://huggingface.co/datasets/daipath/filter-inspection-data) | dataset | 公开 | 1.6 GB | **训练数据**:3728 张图 + 标注 + 切分表 |
| [`daipath/filter-inspection-experiments`](https://huggingface.co/datasets/daipath/filter-inspection-experiments) | dataset | 公开 | 9.3 GB | **复现实验**:全部脚本、51 个训练产物、结果表 |
| `daipath/runpod-workspace-backup` | dataset | **私有** | 1.5 GB | **工作现场归档**:会话历史、原始压缩包、报告 |

> ⚠ 前三个是**公开**的,且包含产品图与模型权重。如果这些属于客户资产,先确认可公开再对外分享链接。

---

## 1 · `daipath/filter-inspection`(模型仓库,公开)

**目的:不装任何东西,下载即用。**

```
binaries/
├── filter-predict-v3            177 MB  ★ 推荐。CPU+GPU 自适应,已修全部打包坑
├── filter-predict-cpu           138 MB  纯 CPU
├── filter-predict-cpu-portable  156 MB  CPU + 内嵌 libstdc++(老系统用)
├── filter-predict-gpu           1.2 GB  GPU(需 CUDA 12.x)
├── filter-predict-gpu-portable  1.2 GB  GPU + 内嵌 libstdc++
└── filter-predict-v2            1.2 GB  历史版本,有 glibc 问题,勿用

filter_binary.onnx    16.0 MB   判废模型(mobilenetv3_large_100)
filter_binary.json     1.6 KB   元信息 + 阈值标定表
filter_4class.onnx    81.2 MB   类型模型(resnet34)
filter_4class.json      276 B
predict.py             7.7 KB   推理源码(想改预处理看这个)
requirements.txt        57 B    onnxruntime numpy pillow openpyxl

weights/                        PyTorch 原始权重,想继续微调用这些
├── binary_mobilenetv3_splitA.pt          16.2 MB  部署用的那个
├── binary_efficientnet_b0_splitA.pt      15.6 MB  test AUROC 最高
├── binary_resnet34_splitB_crossbatch.pt  81.3 MB  跨批次验证用
└── cls4_resnet34_splitA.pt               81.3 MB  四分类

results/                        结果表(不下大文件也能看数字)
├── cls_test_all.csv            42 个模型的 test 榜单
├── cls_all_results.csv         25 个模型的训练期汇总
├── cls_probe_all.csv           诚实性审计
├── shipped_scores_{val,test}.csv  部署模型的逐图分数
├── shipped_summary.json        部署模型超参
└── shipped_trainlog.csv        训练曲线

sample_images/        22 张样例(来自锁箱 test,从未参与训练)
操作指南.md            傻瓜版:下载 + 一条命令
数据集下载指南.md       图片仓库怎么下
```

### 最快路径

```bash
wget https://huggingface.co/daipath/filter-inspection/resolve/main/binaries/filter-predict-v3
chmod +x filter-predict-v3
./filter-predict-v3 -i /你的图片目录 -o 结果.xlsx --with-type
```

**`binaries/` 里 6 个版本,选哪个?**

| 情况 | 用 |
|---|---|
| 不确定 | **`filter-predict-v3`** |
| 只有 CPU,想省流量 | `filter-predict-cpu` |
| 报 `GLIBC_2.38 not found` | `*-portable` 版本 |
| 有 CUDA 12.x 显卡,量大 | `filter-predict-gpu` |

`filter-predict-v2` 有已知 glibc 问题,保留仅作历史记录,**不要用**。

---

## 2 · `daipath/filter-inspection-data`(数据集,公开)

**目的:训自己的模型。**

```
images/          3728 张 PNG + 1977 个 labelme JSON,保持原始 11 包目录结构
splits/
├── splitA/meta.csv      全混合 8:1:1,3611 行
├── splitA/dropped.csv   117 行剔除清单,带原因
├── splitB/meta.csv      跨批次(test = 样本_38016_P08262014 整包)
└── splitB/dropped.csv
inventory.csv            3728 行全量清点
metrics_fixed.csv        1948 行几何指标
数据集下载指南.md
```

```bash
hf download daipath/filter-inspection-data --repo-type dataset --local-dir ./filter-data
```

只要切分表不要图(几 MB):

```bash
hf download daipath/filter-inspection-data --repo-type dataset \
  --local-dir ./filter-data --include "splits/*" "*.csv" "README.md"
```

`meta.csv` 字段与数据质量注意事项见仓库内 `数据集下载指南.md`**用之前务必看 [`CAVEATS.md`](CAVEATS.md) 的第 4 节(6 条数据质量问题)**。

---

## 3 · `daipath/filter-inspection-experiments`(数据集,公开)

**目的:复现全部实验。**

```
03_CV_seg3.tar.zst    2.7 GB   ★ 主实验目录
02_CV_bench.tar.zst   6.6 GB   基准测试与中间产物
```

```bash
hf download daipath/filter-inspection-experiments --repo-type dataset \
  --local-dir ./exp --include "03_CV_seg3.tar.zst"
tar --zstd -xf exp/03_CV_seg3.tar.zst
```

解出来是完整的 `seg3/` 目录:41 个脚本、11 张结果表、5 份 HTML、
**51 个训练产物目录**(每个含 `best.pt` + `summary.json` + `train.log`)。

逐文件说明见 [`FILES.md`](FILES.md),跑法见 [`REPRODUCE.md`](REPRODUCE.md)。

> 需要 `zstd`:`apt install zstd` 或 `tar -I zstd -xf ...`

---

## 4 · `daipath/runpod-workspace-backup`(数据集,**私有**

**目的:RunPod 实例关掉后恢复工作现场。** 这个仓库的存在原因是 pod 的 `home` 会被清空。

```
01_home.tar.zst          252 MB   home 目录 + Claude 会话历史与对话记录
10_home_extra.tar.zst     70 MB   home 补充
04_CV_rawdata.tar.zst    666 MB   原始数据
09_sample_zips.tar.zst   179 MB   样本压缩包原件(样本7_27.zip 等)
06_CV_rars.tar.zst       190 MB   一代 rar 数据
05_CV_reports.tar.zst     60 MB   全部 HTML 报告
07_CV_docs.tar.zst        45 KB   文档(含项目完整重建 md)
08_misc.tar.zst          8.2 MB   杂项
```

**上传时做过 token 脱敏**(会话历史里的密钥已替换)。

需要 token 才能访问:

```bash
export HF_TOKEN=<你的token>
hf download daipath/runpod-workspace-backup --repo-type dataset --local-dir ./backup
```

---

## 上传/下载的两个环境坑

1. **`HF_HUB_DISABLE_XET=1` 必须设**,否则本容器里上传会报 httpx 错误。
   ```bash
   export HF_HUB_DISABLE_XET=1
   ```
2. **私有仓配额已接近上限。** `mgoal-yuxi4-backup` 单独占了 97.59 GB / 100 GB,
   这就是为什么本项目的三个仓库放在**公开**空间。再往私有传会 403。

---

## 遗留事项

- **两个 HF token 曾在对话中明文出现**`hf_kwpc…RaE``hf_GqqT…JfH`),
  应当到 https://huggingface.co/settings/tokens 吊销并重新签发。**目前尚未处理。**
- `filter-inspection``filter-inspection-data` 目前**公开**,内含产品图与模型权重。
  若属客户资产需转私有,先清理私有配额。