Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -13,6 +13,12 @@ balcony, wall, opening`.
|
|
| 13 |
|
| 14 |
Train/valid split: 80/20, seed=42, одинаковый для всех моделей.
|
| 15 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 16 |
## RF-DETR-Seg (Medium)
|
| 17 |
|
| 18 |
`rfdetr_seg/checkpoint_best_ema.pth`
|
|
@@ -210,6 +216,54 @@ RF-DETR-Seg — но на фиксированном пороге 0.1 её F1 п
|
|
| 210 |
открытый вопрос, помогут ли аугментации коллеги в целом, или домен
|
| 211 |
аугментаций слишком расходится с реальными UGC-дефектами.
|
| 212 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 213 |
## SAM fine-tuned — дообучение НЕ помогло (важный отрицательный результат)
|
| 214 |
|
| 215 |
`sam_finetuned/checkpoints/final.pt` (mask_decoder, эпоха 19/20 — эпоха 20 не
|
|
|
|
| 13 |
|
| 14 |
Train/valid split: 80/20, seed=42, одинаковый для всех моделей.
|
| 15 |
|
| 16 |
+
**Этот файл** — журнал экспериментов по обучению моделей, методологии
|
| 17 |
+
оценки и confidence-threshold. Эксперименты с **пост-процессингом
|
| 18 |
+
room/living/bedroom** (заливка по границам, squareness-фильтр, mask-NMS
|
| 19 |
+
для RF-DETR — числа и коллажи) вынесены отдельно:
|
| 20 |
+
[`docs/room_postprocessing_experiments.md`](../docs/room_postprocessing_experiments.md).
|
| 21 |
+
|
| 22 |
## RF-DETR-Seg (Medium)
|
| 23 |
|
| 24 |
`rfdetr_seg/checkpoint_best_ema.pth`
|
|
|
|
| 216 |
открытый вопрос, помогут ли аугментации коллеги в целом, или домен
|
| 217 |
аугментаций слишком расходится с реальными UGC-дефектами.
|
| 218 |
|
| 219 |
+
## Confidence-threshold sweep (2026-08-02): проверка, оптимален ли порог 0.1
|
| 220 |
+
|
| 221 |
+
Единый порог 0.1 выбран для честного кросс-модельного сравнения (см. выше),
|
| 222 |
+
но сам по себе он не обязательно F1-оптимален для каждой модели отдельно.
|
| 223 |
+
Прогнан sweep с шагом 0.05 (mask-NMS iou=0.5 применялся на каждом шаге,
|
| 224 |
+
как в финальном пайплайне) для YOLO-seg и RF-DETR-Seg — двух моделей с
|
| 225 |
+
самой разной калибровкой confidence (см. наблюдение выше про 3104/3387
|
| 226 |
+
детекций RF-DETR со score<0.3 против 56/366 у YOLO).
|
| 227 |
+
|
| 228 |
+
| thresh | YOLO mIoU | YOLO F1(macro) | YOLO room F1 | RF-DETR mIoU | RF-DETR F1(macro) | RF-DETR room F1 |
|
| 229 |
+
|---|---:|---:|---:|---:|---:|---:|
|
| 230 |
+
| 0.05 | 0.300 | 0.524 | 0.551 | 0.213 | 0.385 | 0.675 |
|
| 231 |
+
| 0.10 | 0.300 | 0.524 | 0.551 | 0.213 | 0.385 | 0.675 |
|
| 232 |
+
| 0.15 | 0.300 | 0.524 | 0.551 | 0.262 | 0.455 | **0.746** |
|
| 233 |
+
| **0.20** | 0.300 | 0.524 | 0.551 | 0.264 | **0.468** | 0.672 |
|
| 234 |
+
| 0.25 | 0.300 | 0.524 | 0.551 | 0.249 | 0.455 | 0.418 |
|
| 235 |
+
| 0.30 | 0.277 | 0.493 | 0.527 | 0.244 | 0.447 | 0.291 |
|
| 236 |
+
| 0.35 | 0.234 | 0.432 | 0.474 | 0.157 | 0.308 | 0.103 |
|
| 237 |
+
| 0.40 | 0.223 | 0.414 | 0.389 | 0.134 | 0.332 | 0.000 |
|
| 238 |
+
| 0.50 | 0.176 | 0.339 | 0.310 | 0.093 | 0.243 | 0.000 |
|
| 239 |
+
|
| 240 |
+
(полные данные с шагом 0.05 от 0.05 до 0.95 — см. историю разговора/логи;
|
| 241 |
+
выше — определяющие точки, дальше обе модели монотонно теряют recall и
|
| 242 |
+
F1 падает до нуля к порогу ~0.85-0.90, где не остаётся ни одного
|
| 243 |
+
предсказания)
|
| 244 |
+
|
| 245 |
+
**Выводы:**
|
| 246 |
+
- **YOLO-seg** — на 0.05-0.25 метрики идентичны (0.524/0.551), т.е. в этом
|
| 247 |
+
диапазоне у модели просто нет "шумных" детекций с низким score, которые
|
| 248 |
+
портили бы точность — она изначально хорошо откалибрована. Внутреннего
|
| 249 |
+
оптимума нет, порог **0.1 уже оптимален** (совпадает с любой точкой
|
| 250 |
+
плато), можно было выбрать даже 0.25 без потерь.
|
| 251 |
+
- **RF-DETR-Seg** — здесь порог **реально важен**, и оптимум различается
|
| 252 |
+
по критерию: **macro F1 максимален на 0.20** (0.468, против 0.385 на
|
| 253 |
+
0.1 — прирост +0.083), но **room F1 максимален на 0.15** (0.746, против
|
| 254 |
+
0.675 на 0.1 и 0.672 на 0.20). На 0.20 recall room резко падает
|
| 255 |
+
(0.525 против 0.736 на 0.05-0.10), т.к. отсекается много верных, но
|
| 256 |
+
неуверенных living/bedroom-детекций — trade-off между общей точностью
|
| 257 |
+
по всем классам и recall именно по приоритетному room.
|
| 258 |
+
- Единый порог 0.1 (взят ради честности кросс-модельного сравнения) —
|
| 259 |
+
осознанный компромисс: для RF-DETR он НЕ F1-оптимален (theoretically
|
| 260 |
+
можно было бы выиграть +0.08 macro F1 или +0.07 room F1 индивидуальной
|
| 261 |
+
калибровкой), но подбор порога "под каждую модель отдельно" сделал бы
|
| 262 |
+
сравнение моделей друг с другом нечестным (у каждой был бы свой лучший
|
| 263 |
+
случай). Для итоговой сводной таблицы моделей везде используется 0.1;
|
| 264 |
+
калибровка per-model — открытая возможность для продакшена, а не для
|
| 265 |
+
сравнительного исследования.
|
| 266 |
+
|
| 267 |
## SAM fine-tuned — дообучение НЕ помогло (важный отрицательный результат)
|
| 268 |
|
| 269 |
`sam_finetuned/checkpoints/final.pt` (mask_decoder, эпоха 19/20 — эпоха 20 не
|