| # 四个仓库说明 |
|
|
| | 仓库 | 类型 | 可见性 | 体积 | 用途 | |
| |---|---|---|---|---| |
| | [`daipath/filter-inspection`](https://huggingface.co/daipath/filter-inspection) | model | 公开 | 4.6 GB | **拿来就用**:免安装可执行文件、ONNX、权重 | |
| | [`daipath/filter-inspection-data`](https://huggingface.co/datasets/daipath/filter-inspection-data) | dataset | 公开 | 1.6 GB | **训练数据**:3728 张图 + 标注 + 切分表 | |
| | [`daipath/filter-inspection-experiments`](https://huggingface.co/datasets/daipath/filter-inspection-experiments) | dataset | 公开 | 9.3 GB | **复现实验**:全部脚本、51 个训练产物、结果表 | |
| | `daipath/runpod-workspace-backup` | dataset | **私有** | 1.5 GB | **工作现场归档**:会话历史、原始压缩包、报告 | |
|
|
| > ⚠ 前三个是**公开**的,且包含产品图与模型权重。如果这些属于客户资产,先确认可公开再对外分享链接。 |
|
|
| --- |
|
|
| ## 1 · `daipath/filter-inspection`(模型仓库,公开) |
|
|
| **目的:不装任何东西,下载即用。** |
|
|
| ``` |
| binaries/ |
| ├── filter-predict-v3 177 MB ★ 推荐。CPU+GPU 自适应,已修全部打包坑 |
| ├── filter-predict-cpu 138 MB 纯 CPU |
| ├── filter-predict-cpu-portable 156 MB CPU + 内嵌 libstdc++(老系统用) |
| ├── filter-predict-gpu 1.2 GB GPU(需 CUDA 12.x) |
| ├── filter-predict-gpu-portable 1.2 GB GPU + 内嵌 libstdc++ |
| └── filter-predict-v2 1.2 GB 历史版本,有 glibc 问题,勿用 |
| |
| filter_binary.onnx 16.0 MB 判废模型(mobilenetv3_large_100) |
| filter_binary.json 1.6 KB 元信息 + 阈值标定表 |
| filter_4class.onnx 81.2 MB 类型模型(resnet34) |
| filter_4class.json 276 B |
| predict.py 7.7 KB 推理源码(想改预处理看这个) |
| requirements.txt 57 B onnxruntime numpy pillow openpyxl |
| |
| weights/ PyTorch 原始权重,想继续微调用这些 |
| ├── binary_mobilenetv3_splitA.pt 16.2 MB 部署用的那个 |
| ├── binary_efficientnet_b0_splitA.pt 15.6 MB test AUROC 最高 |
| ├── binary_resnet34_splitB_crossbatch.pt 81.3 MB 跨批次验证用 |
| └── cls4_resnet34_splitA.pt 81.3 MB 四分类 |
| |
| results/ 结果表(不下大文件也能看数字) |
| ├── cls_test_all.csv 42 个模型的 test 榜单 |
| ├── cls_all_results.csv 25 个模型的训练期汇总 |
| ├── cls_probe_all.csv 诚实性审计 |
| ├── shipped_scores_{val,test}.csv 部署模型的逐图分数 |
| ├── shipped_summary.json 部署模型超参 |
| └── shipped_trainlog.csv 训练曲线 |
| |
| sample_images/ 22 张样例(来自锁箱 test,从未参与训练) |
| 操作指南.md 傻瓜版:下载 + 一条命令 |
| 数据集下载指南.md 图片仓库怎么下 |
| ``` |
|
|
| ### 最快路径 |
|
|
| ```bash |
| wget https://huggingface.co/daipath/filter-inspection/resolve/main/binaries/filter-predict-v3 |
| chmod +x filter-predict-v3 |
| ./filter-predict-v3 -i /你的图片目录 -o 结果.xlsx --with-type |
| ``` |
|
|
| **`binaries/` 里 6 个版本,选哪个?** |
|
|
| | 情况 | 用 | |
| |---|---| |
| | 不确定 | **`filter-predict-v3`** | |
| | 只有 CPU,想省流量 | `filter-predict-cpu` | |
| | 报 `GLIBC_2.38 not found` | `*-portable` 版本 | |
| | 有 CUDA 12.x 显卡,量大 | `filter-predict-gpu` | |
|
|
| `filter-predict-v2` 有已知 glibc 问题,保留仅作历史记录,**不要用**。 |
|
|
| --- |
|
|
| ## 2 · `daipath/filter-inspection-data`(数据集,公开) |
|
|
| **目的:训自己的模型。** |
|
|
| ``` |
| images/ 3728 张 PNG + 1977 个 labelme JSON,保持原始 11 包目录结构 |
| splits/ |
| ├── splitA/meta.csv 全混合 8:1:1,3611 行 |
| ├── splitA/dropped.csv 117 行剔除清单,带原因 |
| ├── splitB/meta.csv 跨批次(test = 样本_38016_P08262014 整包) |
| └── splitB/dropped.csv |
| inventory.csv 3728 行全量清点 |
| metrics_fixed.csv 1948 行几何指标 |
| 数据集下载指南.md |
| ``` |
|
|
| ```bash |
| hf download daipath/filter-inspection-data --repo-type dataset --local-dir ./filter-data |
| ``` |
|
|
| 只要切分表不要图(几 MB): |
|
|
| ```bash |
| hf download daipath/filter-inspection-data --repo-type dataset \ |
| --local-dir ./filter-data --include "splits/*" "*.csv" "README.md" |
| ``` |
|
|
| `meta.csv` 字段与数据质量注意事项见仓库内 `数据集下载指南.md`, |
| **用之前务必看 [`CAVEATS.md`](CAVEATS.md) 的第 4 节(6 条数据质量问题)**。 |
|
|
| --- |
|
|
| ## 3 · `daipath/filter-inspection-experiments`(数据集,公开) |
|
|
| **目的:复现全部实验。** |
|
|
| ``` |
| 03_CV_seg3.tar.zst 2.7 GB ★ 主实验目录 |
| 02_CV_bench.tar.zst 6.6 GB 基准测试与中间产物 |
| ``` |
|
|
| ```bash |
| hf download daipath/filter-inspection-experiments --repo-type dataset \ |
| --local-dir ./exp --include "03_CV_seg3.tar.zst" |
| tar --zstd -xf exp/03_CV_seg3.tar.zst |
| ``` |
|
|
| 解出来是完整的 `seg3/` 目录:41 个脚本、11 张结果表、5 份 HTML、 |
| **51 个训练产物目录**(每个含 `best.pt` + `summary.json` + `train.log`)。 |
|
|
| 逐文件说明见 [`FILES.md`](FILES.md),跑法见 [`REPRODUCE.md`](REPRODUCE.md)。 |
|
|
| > 需要 `zstd`:`apt install zstd` 或 `tar -I zstd -xf ...` |
|
|
| --- |
|
|
| ## 4 · `daipath/runpod-workspace-backup`(数据集,**私有**) |
|
|
| **目的:RunPod 实例关掉后恢复工作现场。** 这个仓库的存在原因是 pod 的 `home` 会被清空。 |
|
|
| ``` |
| 01_home.tar.zst 252 MB home 目录 + Claude 会话历史与对话记录 |
| 10_home_extra.tar.zst 70 MB home 补充 |
| 04_CV_rawdata.tar.zst 666 MB 原始数据 |
| 09_sample_zips.tar.zst 179 MB 样本压缩包原件(样本7_27.zip 等) |
| 06_CV_rars.tar.zst 190 MB 一代 rar 数据 |
| 05_CV_reports.tar.zst 60 MB 全部 HTML 报告 |
| 07_CV_docs.tar.zst 45 KB 文档(含项目完整重建 md) |
| 08_misc.tar.zst 8.2 MB 杂项 |
| ``` |
|
|
| **上传时做过 token 脱敏**(会话历史里的密钥已替换)。 |
|
|
| 需要 token 才能访问: |
|
|
| ```bash |
| export HF_TOKEN=<你的token> |
| hf download daipath/runpod-workspace-backup --repo-type dataset --local-dir ./backup |
| ``` |
|
|
| --- |
|
|
| ## 上传/下载的两个环境坑 |
|
|
| 1. **`HF_HUB_DISABLE_XET=1` 必须设**,否则本容器里上传会报 httpx 错误。 |
| ```bash |
| export HF_HUB_DISABLE_XET=1 |
| ``` |
| 2. **私有仓配额已接近上限。** `mgoal-yuxi4-backup` 单独占了 97.59 GB / 100 GB, |
| 这就是为什么本项目的三个仓库放在**公开**空间。再往私有传会 403。 |
|
|
| --- |
|
|
| ## 遗留事项 |
|
|
| - **两个 HF token 曾在对话中明文出现**(`hf_kwpc…RaE`、`hf_GqqT…JfH`), |
| 应当到 https://huggingface.co/settings/tokens 吊销并重新签发。**目前尚未处理。** |
| - `filter-inspection` 与 `filter-inspection-data` 目前**公开**,内含产品图与模型权重。 |
| 若属客户资产需转私有,先清理私有配额。 |
|
|