WSSS
WSSS SOTA 연구용역 · COCO-Val mIoU 53.31% · WeCLIP+ 대비 +1.5%p
Built with PyTorch · CLIP · DINOv2 · Semantic segmentation · COCO-Val 2014
WHY
클라이언트로부터 이미지 단위 정답만 사용해 당시 SOTA였던 WeCLIP+의 성능을 개선하는 연구용역을 의뢰받았습니다. 자동으로 만든 pseudo-mask에는 객체 경계와 배경의 잘못된 pixel이 포함됐고, 이 오류는 self-training을 반복할수록 누적됐습니다. 전체 mask를 다시 만드는 대신 신뢰하기 어려운 pixel만 찾아 복원할 수 있는지가 핵심 연구 질문이었습니다.
전체 validation image로 평가
최종 semantic segmentation 성능
WeCLIP+ 51.8% mIoU 기준
HOW
이미지 정답에서 신뢰 가능한 pixel supervision까지
강한 pretrained representation은 그대로 유지하고, 자동 생성된 mask에서 불확실한 부분에만 학습을 집중했습니다.
- 01 Frozen representation
CLIP과 DINOv2 backbone을 업데이트하지 않고 서로 다른 시각 정보를 추출합니다.
- 02 Reliability map
두 표현이 같은 pixel assignment를 지지하는지 비교해 신뢰하기 어려운 영역을 찾습니다.
- 03 Pixel repair
전체 pseudo-mask를 다시 만들지 않고, 의견이 다른 pixel만 선택적으로 복원합니다.
- 04 Segmentation 학습
복원된 mask를 supervision으로 사용해 feature-fusion head와 segmentation decoder를 학습합니다.
RESULT
COCO-Val 성능 비교
| Method | Supervision | mIoU |
|---|---|---|
| WeCLIP+ | Image-level labels | 51.80% |
| Refined pseudo-label method | Image-level labels | 53.31% |
두 결과 모두 COCO-Val 2014 전체 평가셋을 사용했습니다.
기여
- Frozen CLIP과 DINOv2 representation을 이용한 pixel reliability와 selective repair 방법을 설계했습니다.
- Pseudo-label refinement부터 재학습까지 전체 pipeline을 구현하고 COCO-Val 2014 전체 데이터로 최종 성능을 평가했습니다.