detection-datasets/coco
Viewer • Updated • 122k • 27.6k • 82
本仓库提供标准 SSD300 目标检测模型的 ONNX 与昇腾离线模型文件。SSD300 是经典的一阶段目标检测网络,全称为 Single Shot MultiBox Detector:模型在一次前向推理中同时完成候选框位置回归和类别置信度预测,不需要像两阶段检测器那样先生成 region proposals。
这里的“300”表示模型固定使用 300 x 300 的输入分辨率。仓库中的模型采用标准 SSD300 的检测头、默认框数量和输出形式,并提供不同 ResNet 骨干网络版本,便于在速度、模型大小和检测精度之间做取舍。
1 x 3 x 300 x 300,对应 batch、通道、高、宽。81,通常表示 COCO 的 80 个目标类别加 1 个背景类。8732 个默认框,这是标准 SSD300 结构的典型配置。SSD300 由三部分组成:
骨干网络 用于提取图像特征。本仓库提供 ResNet-18、ResNet-34、ResNet-50、ResNet-101 和 ResNet-151 版本。骨干网络越深,特征表达能力通常越强,但模型体积和计算量也会增加。
多尺度检测特征层 SSD 不只在最后一层特征上检测目标,而是在多个尺度的特征图上同时预测。这样可以兼顾小目标、中等目标和大目标。
分类与回归检测头 每个检测位置都会输出两类信息:
boxes:默认框的位置回归结果,用于还原最终边界框。scores:每个默认框在各个类别上的置信度分数。推理后通常还需要进行解码、置信度筛选和 NMS(Non-Maximum Suppression,非极大值抑制),得到最终检测框、类别和分数。
| 骨干网络 | ONNX 文件 | OM 文件 | ONNX 大小 | OM 大小 |
|---|---|---|---|---|
| ResNet-18 | ssd300_resnet18.onnx |
ssd300_resnet18.om |
53.60 MB | 27.95 MB |
| ResNet-34 | ssd300_resnet34.onnx |
ssd300_resnet34.om |
76.21 MB | 39.43 MB |
| ResNet-50 | ssd300_resnet50.onnx |
ssd300_resnet50.om |
87.32 MB | 45.28 MB |
| ResNet-101 | ssd300_resnet101.onnx |
ssd300_resnet101.om |
159.71 MB | 81.97 MB |
| ResNet-151 | ssd300_resnet151.onnx |
ssd300_resnet151.om |
219.34 MB | 112.29 MB |
所有 ONNX 模型的接口一致:
| 名称 | 类型 | 形状 | 说明 |
|---|---|---|---|
input |
float32 |
1 x 3 x 300 x 300 |
输入图像张量,NCHW 格式 |
boxes |
float32 |
1 x 4 x 8732 |
每个默认框对应的边界框回归输出 |
scores |
float32 |
1 x 81 x 8732 |
每个默认框对应的类别分数输出 |
说明:
300 x 300。C x H x W。scores 为原始类别分数,后处理时通常需要按训练导出方式配合 softmax 或等价逻辑使用。boxes 不是直接可视化的最终框,通常需要结合 SSD300 的默认框进行解码。300 x 300。boxes 和 scores 做 SSD 解码。.onnx)**:通用神经网络交换格式,可用于 ONNX Runtime、TensorRT、OpenVINO 等推理后端,也可作为进一步转换部署格式的中间模型。.om)**:华为昇腾 NPU 使用的离线模型格式,通常由 ATC 工具基于 ONNX 模型转换得到,适合在 Ascend 310、Ascend 910 等设备上部署。SSD300 结构轻量、推理链路短,适合以下场景:
如果优先考虑速度,可以选择 ResNet-18 或 ResNet-34 版本;如果更关注特征表达能力,可以选择 ResNet-50、ResNet-101 或 ResNet-151 版本。
Base model
microsoft/resnet-50