nabiullina-dstu commited on
Commit
aebabee
·
verified ·
1 Parent(s): 3ee30a8

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +54 -0
README.md CHANGED
@@ -13,6 +13,12 @@ balcony, wall, opening`.
13
 
14
  Train/valid split: 80/20, seed=42, одинаковый для всех моделей.
15
 
 
 
 
 
 
 
16
  ## RF-DETR-Seg (Medium)
17
 
18
  `rfdetr_seg/checkpoint_best_ema.pth`
@@ -210,6 +216,54 @@ RF-DETR-Seg — но на фиксированном пороге 0.1 её F1 п
210
  открытый вопрос, помогут ли аугментации коллеги в целом, или домен
211
  аугментаций слишком расходится с реальными UGC-дефектами.
212
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
213
  ## SAM fine-tuned — дообучение НЕ помогло (важный отрицательный результат)
214
 
215
  `sam_finetuned/checkpoints/final.pt` (mask_decoder, эпоха 19/20 — эпоха 20 не
 
13
 
14
  Train/valid split: 80/20, seed=42, одинаковый для всех моделей.
15
 
16
+ **Этот файл** — журнал экспериментов по обучению моделей, методологии
17
+ оценки и confidence-threshold. Эксперименты с **пост-процессингом
18
+ room/living/bedroom** (заливка по границам, squareness-фильтр, mask-NMS
19
+ для RF-DETR — числа и коллажи) вынесены отдельно:
20
+ [`docs/room_postprocessing_experiments.md`](../docs/room_postprocessing_experiments.md).
21
+
22
  ## RF-DETR-Seg (Medium)
23
 
24
  `rfdetr_seg/checkpoint_best_ema.pth`
 
216
  открытый вопрос, помогут ли аугментации коллеги в целом, или домен
217
  аугментаций слишком расходится с реальными UGC-дефектами.
218
 
219
+ ## Confidence-threshold sweep (2026-08-02): проверка, оптимален ли порог 0.1
220
+
221
+ Единый порог 0.1 выбран для честного кросс-модельного сравнения (см. выше),
222
+ но сам по себе он не обязательно F1-оптимален для каждой модели отдельно.
223
+ Прогнан sweep с шагом 0.05 (mask-NMS iou=0.5 применялся на каждом шаге,
224
+ как в финальном пайплайне) для YOLO-seg и RF-DETR-Seg — двух моделей с
225
+ самой разной калибровкой confidence (см. наблюдение выше про 3104/3387
226
+ детекций RF-DETR со score<0.3 против 56/366 у YOLO).
227
+
228
+ | thresh | YOLO mIoU | YOLO F1(macro) | YOLO room F1 | RF-DETR mIoU | RF-DETR F1(macro) | RF-DETR room F1 |
229
+ |---|---:|---:|---:|---:|---:|---:|
230
+ | 0.05 | 0.300 | 0.524 | 0.551 | 0.213 | 0.385 | 0.675 |
231
+ | 0.10 | 0.300 | 0.524 | 0.551 | 0.213 | 0.385 | 0.675 |
232
+ | 0.15 | 0.300 | 0.524 | 0.551 | 0.262 | 0.455 | **0.746** |
233
+ | **0.20** | 0.300 | 0.524 | 0.551 | 0.264 | **0.468** | 0.672 |
234
+ | 0.25 | 0.300 | 0.524 | 0.551 | 0.249 | 0.455 | 0.418 |
235
+ | 0.30 | 0.277 | 0.493 | 0.527 | 0.244 | 0.447 | 0.291 |
236
+ | 0.35 | 0.234 | 0.432 | 0.474 | 0.157 | 0.308 | 0.103 |
237
+ | 0.40 | 0.223 | 0.414 | 0.389 | 0.134 | 0.332 | 0.000 |
238
+ | 0.50 | 0.176 | 0.339 | 0.310 | 0.093 | 0.243 | 0.000 |
239
+
240
+ (полные данные с шагом 0.05 от 0.05 до 0.95 — см. историю разговора/логи;
241
+ выше — определяющие точки, дальше обе модели монотонно теряют recall и
242
+ F1 падает до нуля к порогу ~0.85-0.90, где не остаётся ни одного
243
+ предсказания)
244
+
245
+ **Выводы:**
246
+ - **YOLO-seg** — на 0.05-0.25 метрики идентичны (0.524/0.551), т.е. в этом
247
+ диапазоне у модели просто нет "шумных" детекций с низким score, которые
248
+ портили бы точность — она изначально хорошо откалибрована. Внутреннего
249
+ оптимума нет, порог **0.1 уже оптимален** (совпадает с любой точкой
250
+ плато), можно было выбрать даже 0.25 без потерь.
251
+ - **RF-DETR-Seg** — здесь порог **реально важен**, и оптимум различается
252
+ по критерию: **macro F1 максимален на 0.20** (0.468, против 0.385 на
253
+ 0.1 — прирост +0.083), но **room F1 максимален на 0.15** (0.746, против
254
+ 0.675 на 0.1 и 0.672 на 0.20). На 0.20 recall room резко падает
255
+ (0.525 против 0.736 на 0.05-0.10), т.к. отсекается много верных, но
256
+ неуверенных living/bedroom-детекций — trade-off между общей точностью
257
+ по всем классам и recall именно по приоритетному room.
258
+ - Единый порог 0.1 (взят ради честности кросс-модельного сравнения) —
259
+ осознанный компромисс: для RF-DETR он НЕ F1-оптимален (theoretically
260
+ можно было бы выиграть +0.08 macro F1 или +0.07 room F1 индивидуальной
261
+ калибровкой), но подбор порога "под каждую модель отдельно" сделал бы
262
+ сравнение моделей друг с другом нечестным (у каждой был бы свой лучший
263
+ случай). Для итоговой сводной таблицы моделей везде используется 0.1;
264
+ калибровка per-model — открытая возможность для продакшена, а не для
265
+ сравнительного исследования.
266
+
267
  ## SAM fine-tuned — дообучение НЕ помогло (важный отрицательный результат)
268
 
269
  `sam_finetuned/checkpoints/final.pt` (mask_decoder, эпоха 19/20 — эпоха 20 не