nabiullina-dstu commited on
Commit
3ee30a8
·
verified ·
1 Parent(s): 8481793

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +45 -19
README.md CHANGED
@@ -143,27 +143,53 @@ IoU/Dice/Precision/Recall — с двумя правками (2026-08-01/02):
143
  ⚠️ Для Mask R-CNN это не сработало: её сырые предсказания на school19
144
  уже отфильтрованы на инференсе на ≥0.3 (нужен повторный запуск с
145
  `--score-thr 0.1`, пока не переделан).
 
 
 
 
 
146
 
147
  mAP-колонки НЕ учитывают ни одну из этих правок (там живёт своя, отдельная
148
- логика COCOeval, не завязанная на единый порог).
149
-
150
- | Модель | Эпох | mask AP@50 | mask AP@50:95 | IoU | Dice | Precision | Recall |
151
- |---|---|---:|---:|---:|---:|---:|---:|
152
- | RF-DETR-Seg (Medium) | 4 | 0.329 | 0.216 | 0.163 | 0.254 | 0.168 | 0.744 |
153
- | RF-DETR-Seg fullaug | 8 (остановлено) | 0.200 | 0.123 | 0.254 | 0.386 | 0.754 | 0.308 |
154
- | YOLO-seg | 53 | 0.280 | 0.184 | 0.311 | 0.451 | 0.804 | 0.363 |
155
- | YOLO-seg fullaug | 54 (остановлено) | 0.240 | 0.154 | 0.236 | 0.357 | 0.801 | 0.271 |
156
- | Mask R-CNN | ~ | 0.218 | 0.142 | 0.208 | 0.320 | 0.582 | 0.296 |
157
- | SegFormer (b2, семантическая) | 60 | 0.085 | 0.035 | 0.192 | 0.300 | 0.348 | 0.454 |
158
- | UNet-simple (внешняя, семантическая) | 24 | 0.054 | 0.023 | 0.212 | 0.329 | 0.279 | 0.482 |
159
- | SAM zero-shot (Grounded-SAM) | 0 | 0.002 | 0.0016 | 0.024 | 0.045 | 0.043 | 0.168 |
160
- | SAM fine-tuned | 19/20 | 0.0002 | 0.0001 | 0.013 | 0.025 | 0.025 | 0.050 |
161
-
162
- RF-DETR (обычная) на пороге 0.1 показывает резкий сдвиг recall↑/precision↓
163
- (0.744/0.168) — при этом пороге у неё 3104 из 3387 предсказаний имеют
164
- score < 0.3, то есть подавляющее большинство "детекций" низкоуверенный шум.
165
- YOLO при том же пороге держит баланс лучше (precision=0.804 при recall=0.363)
166
- её сырые предсказания изначально более уверенные олько 56 из 366 ниже 0.3).
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
167
 
168
  Наблюдения:
169
  - Провал между валидацией на синтетике (~0.6-0.9 mAP/mIoU) и UGC test
 
143
  ⚠️ Для Mask R-CNN это не сработало: её сырые предсказания на school19
144
  уже отфильтрованы на инференсе на ≥0.3 (нужен повторный запуск с
145
  `--score-thr 0.1`, пока не переделан).
146
+ 3. **Mask-NMS** (`eval/mask_nms.py`, IoU>0.5, кросс-классовый) — на пороге 0.1
147
+ модели (особенно RF-DETR) выдают много перекрывающихся дублей одного и
148
+ того же объекта; оставляем только самую уверенную маску из группы.
149
+ 4. Добавлена **F1** (2·P·R/(P+R)) — единая сводная метрика вместо разбора
150
+ двух чисел по отдельности.
151
 
152
  mAP-колонки НЕ учитывают ни одну из этих правок (там живёт своя, отдельная
153
+ логика COCOeval, не завязанная на единый порог/NMS).
154
+
155
+ ### По моделям (агрегат по классам)
156
+
157
+ | Модель | IoU | Dice | Precision | Recall | **F1** | mAP@50 | mAP@50:95 |
158
+ |---|---:|---:|---:|---:|---:|---:|---:|
159
+ | **YOLO-seg** | 0.300 | 0.437 | 0.803 | 0.348 | **0.524** | 0.279 | 0.184 |
160
+ | RF-DETR fullaug | 0.254 | 0.386 | 0.759 | 0.305 | 0.463 | 0.200 | 0.123 |
161
+ | YOLO fullaug | 0.233 | 0.354 | 0.802 | 0.267 | 0.424 | 0.240 | 0.154 |
162
+ | UNet-simple (семантическая) | 0.212 | 0.330 | 0.280 | 0.482 | 0.396 | 0.053 | 0.023 |
163
+ | Mask R-CNN | 0.209 | 0.322 | 0.597 | 0.290 | 0.387 | 0.218 | 0.142 |
164
+ | RF-DETR-Seg (Medium) | 0.213 | 0.321 | 0.247 | 0.616 | 0.385 | 0.329 | **0.216** |
165
+ | SegFormer (семантическая) | 0.192 | 0.300 | 0.348 | 0.454 | 0.360 | 0.085 | 0.035 |
166
+ | SAM zero-shot (Grounded-SAM) | 0.022 | 0.041 | 0.040 | 0.099 | 0.082 | 0.002 | 0.002 |
167
+ | SAM fine-tuned | 0.011 | 0.021 | 0.022 | 0.037 | 0.042 | 0.001 | 0.000 |
168
+
169
+ По F1 лидирует YOLO-seg (лучший баланс precision/recall). По mAP (не
170
+ зависит от единого порога, полноценно интегрирует всю P-R кривую) лидирует
171
+ RF-DETR-Seg но на фиксированном пороге 0.1 её F1 просаживается, т.к. у неё
172
+ 3104 из 3387 сырых предсказаний имеют score < 0.3 (низкоуверенный шум,
173
+ плохая калибровка confidence по сравнению с YOLO, где таких лишь 56 из 366).
174
+
175
+ ### По классам (F1)
176
+
177
+ | Модель | bathroom | kitchen | balcony | wall | opening | room |
178
+ |---|---:|---:|---:|---:|---:|---:|
179
+ | RF-DETR-Seg | 0.16 | 0.21 | — | 0.46 | 0.42 | 0.67 |
180
+ | RF-DETR fullaug | 0.31 | 0.48 | — | 0.54 | 0.45 | 0.54 |
181
+ | **YOLO-seg** | **0.64** | 0.38 | — | 0.58 | 0.48 | 0.55 |
182
+ | YOLO fullaug | 0.55 | 0.15 | — | 0.53 | 0.49 | 0.41 |
183
+ | Mask R-CNN | 0.38 | 0.32 | — | 0.17 | 0.42 | **0.64** |
184
+ | SegFormer | 0.16 | 0.26 | — | 0.56 | 0.31 | 0.51 |
185
+ | SAM zero-shot | — | — | 0.01 | — | 0.06 | 0.17 |
186
+ | SAM fine-tuned | — | — | 0.00 | — | 0.08 | 0.05 |
187
+ | UNet-simple | 0.26 | 0.30 | — | 0.51 | 0.34 | 0.57 |
188
+
189
+ `—` = в GT+предсказаниях этой модели вообще не было пикселей класса (не 0 —
190
+ "не оценивалось"). `balcony` пуст почти у всех — в GT слишком мало
191
+ инстансов для устойчивой оценки, кроме SAM (у неё столько лишних
192
+ предсказаний, что она случайно "накрывает" единичные balcony-пиксели).
193
 
194
  Наблюдения:
195
  - Провал между валидацией на синтетике (~0.6-0.9 mAP/mIoU) и UGC test