Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -143,27 +143,53 @@ IoU/Dice/Precision/Recall — с двумя правками (2026-08-01/02):
|
|
| 143 |
⚠️ Для Mask R-CNN это не сработало: её сырые предсказания на school19
|
| 144 |
уже отфильтрованы на инференсе на ≥0.3 (нужен повторный запуск с
|
| 145 |
`--score-thr 0.1`, пока не переделан).
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 146 |
|
| 147 |
mAP-колонки НЕ учитывают ни одну из этих правок (там живёт своя, отдельная
|
| 148 |
-
логика COCOeval, не завязанная на единый порог).
|
| 149 |
-
|
| 150 |
-
|
| 151 |
-
|
| 152 |
-
|
|
| 153 |
-
|
|
| 154 |
-
| YOLO-seg |
|
| 155 |
-
|
|
| 156 |
-
|
|
| 157 |
-
|
|
| 158 |
-
|
|
| 159 |
-
|
|
| 160 |
-
|
|
| 161 |
-
|
| 162 |
-
|
| 163 |
-
|
| 164 |
-
|
| 165 |
-
|
| 166 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 167 |
|
| 168 |
Наблюдения:
|
| 169 |
- Провал между валидацией на синтетике (~0.6-0.9 mAP/mIoU) и UGC test
|
|
|
|
| 143 |
⚠️ Для Mask R-CNN это не сработало: её сырые предсказания на school19
|
| 144 |
уже отфильтрованы на инференсе на ≥0.3 (нужен повторный запуск с
|
| 145 |
`--score-thr 0.1`, пока не переделан).
|
| 146 |
+
3. **Mask-NMS** (`eval/mask_nms.py`, IoU>0.5, кросс-классовый) — на пороге 0.1
|
| 147 |
+
модели (особенно RF-DETR) выдают много перекрывающихся дублей одного и
|
| 148 |
+
того же объекта; оставляем только самую уверенную маску из группы.
|
| 149 |
+
4. Добавлена **F1** (2·P·R/(P+R)) — единая сводная метрика вместо разбора
|
| 150 |
+
двух чисел по отдельности.
|
| 151 |
|
| 152 |
mAP-колонки НЕ учитывают ни одну из этих правок (там живёт своя, отдельная
|
| 153 |
+
логика COCOeval, не завязанная на единый порог/NMS).
|
| 154 |
+
|
| 155 |
+
### По моделям (агрегат по классам)
|
| 156 |
+
|
| 157 |
+
| Модель | IoU | Dice | Precision | Recall | **F1** | mAP@50 | mAP@50:95 |
|
| 158 |
+
|---|---:|---:|---:|---:|---:|---:|---:|
|
| 159 |
+
| **YOLO-seg** | 0.300 | 0.437 | 0.803 | 0.348 | **0.524** | 0.279 | 0.184 |
|
| 160 |
+
| RF-DETR fullaug | 0.254 | 0.386 | 0.759 | 0.305 | 0.463 | 0.200 | 0.123 |
|
| 161 |
+
| YOLO fullaug | 0.233 | 0.354 | 0.802 | 0.267 | 0.424 | 0.240 | 0.154 |
|
| 162 |
+
| UNet-simple (семантическая) | 0.212 | 0.330 | 0.280 | 0.482 | 0.396 | 0.053 | 0.023 |
|
| 163 |
+
| Mask R-CNN | 0.209 | 0.322 | 0.597 | 0.290 | 0.387 | 0.218 | 0.142 |
|
| 164 |
+
| RF-DETR-Seg (Medium) | 0.213 | 0.321 | 0.247 | 0.616 | 0.385 | 0.329 | **0.216** |
|
| 165 |
+
| SegFormer (семантическая) | 0.192 | 0.300 | 0.348 | 0.454 | 0.360 | 0.085 | 0.035 |
|
| 166 |
+
| SAM zero-shot (Grounded-SAM) | 0.022 | 0.041 | 0.040 | 0.099 | 0.082 | 0.002 | 0.002 |
|
| 167 |
+
| SAM fine-tuned | 0.011 | 0.021 | 0.022 | 0.037 | 0.042 | 0.001 | 0.000 |
|
| 168 |
+
|
| 169 |
+
По F1 лидирует YOLO-seg (лучший баланс precision/recall). По mAP (не
|
| 170 |
+
зависит от единого порога, полноценно интегрирует всю P-R кривую) лидирует
|
| 171 |
+
RF-DETR-Seg — но на фиксированном пороге 0.1 её F1 просаживается, т.к. у неё
|
| 172 |
+
3104 из 3387 сырых предсказаний имеют score < 0.3 (низкоуверенный шум,
|
| 173 |
+
плохая калибровка confidence по сравнению с YOLO, где таких лишь 56 из 366).
|
| 174 |
+
|
| 175 |
+
### По классам (F1)
|
| 176 |
+
|
| 177 |
+
| Модель | bathroom | kitchen | balcony | wall | opening | room |
|
| 178 |
+
|---|---:|---:|---:|---:|---:|---:|
|
| 179 |
+
| RF-DETR-Seg | 0.16 | 0.21 | — | 0.46 | 0.42 | 0.67 |
|
| 180 |
+
| RF-DETR fullaug | 0.31 | 0.48 | — | 0.54 | 0.45 | 0.54 |
|
| 181 |
+
| **YOLO-seg** | **0.64** | 0.38 | — | 0.58 | 0.48 | 0.55 |
|
| 182 |
+
| YOLO fullaug | 0.55 | 0.15 | — | 0.53 | 0.49 | 0.41 |
|
| 183 |
+
| Mask R-CNN | 0.38 | 0.32 | — | 0.17 | 0.42 | **0.64** |
|
| 184 |
+
| SegFormer | 0.16 | 0.26 | — | 0.56 | 0.31 | 0.51 |
|
| 185 |
+
| SAM zero-shot | — | — | 0.01 | — | 0.06 | 0.17 |
|
| 186 |
+
| SAM fine-tuned | — | — | 0.00 | — | 0.08 | 0.05 |
|
| 187 |
+
| UNet-simple | 0.26 | 0.30 | — | 0.51 | 0.34 | 0.57 |
|
| 188 |
+
|
| 189 |
+
`—` = в GT+предсказаниях этой модели вообще не было пикселей класса (не 0 —
|
| 190 |
+
"не оценивалось"). `balcony` пуст почти у всех — в GT слишком мало
|
| 191 |
+
инстансов для устойчивой оценки, кроме SAM (у неё столько лишних
|
| 192 |
+
предсказаний, что она случайно "накрывает" единичные balcony-пиксели).
|
| 193 |
|
| 194 |
Наблюдения:
|
| 195 |
- Провал между валидацией на синтетике (~0.6-0.9 mAP/mIoU) и UGC test
|