BÁO CÁO TỔNG HỢP INSIGHT (V2 - V5): ĐƯỜNG ĐẾN SOTA
Tài liệu này đúc kết toàn bộ bài học từ 4 đợt thử nghiệm lớn để thiết kế bản Chốt (V6).
1. Các cột mốc quan trọng (Milestones)
| Phiên bản | Thay đổi chính | Kết quả p08 | Kết quả p11 | Bài học rút ra |
|---|---|---|---|---|
| V1 (Baseline) | Concat + MLP | 6.48° | 4.07° | Mốc tham chiếu cơ bản. |
| V3 (Hybrid) | DualPool + Shuffle | 6.23° | -- | Trộn kênh giúp học quan hệ không gian. |
| V4 (Gated) | Sigmoid Gating | 10.86° | -- | Gating cực kỳ khó hội tụ và dễ bão hòa. |
| V5 (Ultra) | GT-Only + BN | 5.98° | 3.90° | Tín hiệu GT là thật nhất. BN giúp giữ độ tương phản. |
| V6 (Stabilizer) | DualPool+Shuffle+LN | -- | > 6.0° | THẤT BẠI. LN làm mất contrast, OneCycle quá gắt. |
2. Phát hiện "Tử huyệt" Kỹ thuật
A. Sự thất bại của Layer Norm (LN) vs. Batch Norm (BN)
- Vấn đề V6: MAE tăng dần trong khi Loss giảm (Overfitting cực nặng).
- Insight: Layer Norm chuẩn hóa trên từng mẫu độc lập, vô tình "san phẳng" sự khác biệt về độ sáng giữa con ngươi và lòng trắng mắt trong các patch 16x16.
- Kết luận: Batch Norm là bắt buộc. BN giữ lại được "bản sắc" của con ngươi thông qua thống kê toàn batch, giúp model định vị chính xác hơn.
B. Vấn đề của OneCycleLR
- Insight: Với dữ liệu 100% Ground Truth (không có Teacher giữ nhịp), mức LR
1.2e-4ở đỉnh của OneCycle là quá cao, khiến model bị "văng" khỏi vùng tối ưu của p11/p08. - Bài học: Quay lại mức LR thấp cố định (5e-5 đến 7e-5) mang lại sự điềm tĩnh cần thiết cho model.
3. Bản Chốt thực tế (The Reverted V5 Gold)
Dựa trên bằng chứng thực tế, chúng ta quay lại cấu trúc V5 nhưng giữ lại phần DualPool để tối đa hóa tính năng:
- Backbone: Dual Pooling (Avg+Max).
- Norm: Batch Normalization (Không dùng Layer Norm).
- Loss: 100% Ground Truth (Smooth AW Loss).
- Schedule: ReduceLROnPlateau (Chậm mà chắc).