EAT
의료 이미지 E-AT 연구 · macro-F1 0.8647 · ECE 1.03% vs. CR-SAM 1.7%
Built with PyTorch · ConvNeXtV2-Tiny · Focal loss · R-Drop · FGM · ISIC 2019
WHY
의료 이미지 모델은 정답을 맞히는 것만큼 틀릴 때 얼마나 확신하는지도 중요합니다. 정확도가 비슷해도 틀린 예측에 높은 confidence를 주는 모델은 사람이 결과를 과신하게 만들 수 있습니다. 분류 성능을 유지하면서 예측 confidence의 신뢰도까지 같은 학습 과정에서 개선할 수 있는지를 연구했습니다.
Balanced · ConvNeXtV2-Tiny · 384 px
Best classification result
CR-SAM (AAAI 2024): 1.7%
HOW
분류 성능과 믿을 수 있는 confidence를 함께 학습하기
학습이 끝난 뒤 calibration만 보정하는 대신 sample difficulty, perturbation과 prediction consistency를 하나의 objective로 연결했습니다.
- 01 이미지와 class label
Clean stochastic forward에서 target class confidence와 각 ISIC 이미지의 difficulty를 계산합니다.
- 02 Focal difficulty
모든 샘플을 같은 비중으로 보지 않고 어려운 샘플이 loss에 더 크게 반영되도록 합니다.
- 03 Adaptive FGM
Sample difficulty에 맞춘 제한된 perturbation으로 두 번째 stochastic prediction을 계산합니다.
- 04 R-Drop update
분류 loss와 두 prediction의 bidirectional consistency를 한 번의 update로 함께 최적화합니다.
RESULT
ISIC 결과
| Metric | E-AT 결과 | Selection |
|---|---|---|
| Macro-F1 ↑ | 0.8647 | Classification checkpoint |
| ECE ↓ | 1.03% | Calibration checkpoint |
| CR-SAM ECE ↓ | 1.7% | AAAI 2024 reference |
Macro-F1과 ECE는 각각의 best checkpoint 기준입니다.
기여
- Focal difficulty, adaptive FGM과 bidirectional R-Drop을 연결한 E-AT objective를 설계했습니다.
- 균형 ISIC 학습·평가 pipeline을 만들고 macro-F1과 ECE를 분리해 추적했습니다.
관련 자료
비공개 프로젝트