← 모든 글

WSSS

WSSS SOTA 연구용역 · COCO-Val mIoU 53.31% · WeCLIP+ 대비 +1.5%p

Built with PyTorch · CLIP · DINOv2 · Semantic segmentation · COCO-Val 2014

COCO-Val 2014 전체 40,137개 이미지에서 WeCLIP+ 51.8% mIoU와 refined method 53.31% mIoU를 비교한 막대그래프
COCO-Val 2014 · validation image 40,137개 전체 · mIoU

WHY

클라이언트로부터 이미지 단위 정답만 사용해 당시 SOTA였던 WeCLIP+의 성능을 개선하는 연구용역을 의뢰받았습니다. 자동으로 만든 pseudo-mask에는 객체 경계와 배경의 잘못된 pixel이 포함됐고, 이 오류는 self-training을 반복할수록 누적됐습니다. 전체 mask를 다시 만드는 대신 신뢰하기 어려운 pixel만 찾아 복원할 수 있는지가 핵심 연구 질문이었습니다.

COCO-Val 2014 40,137 images

전체 validation image로 평가

Refined WSSS 53.31% mIoU

최종 semantic segmentation 성능

기존 SOTA 대비 +1.5%p

WeCLIP+ 51.8% mIoU 기준

HOW

이미지 정답에서 신뢰 가능한 pixel supervision까지

강한 pretrained representation은 그대로 유지하고, 자동 생성된 mask에서 불확실한 부분에만 학습을 집중했습니다.

  1. 01 Frozen representation

    CLIP과 DINOv2 backbone을 업데이트하지 않고 서로 다른 시각 정보를 추출합니다.

  2. 02 Reliability map

    두 표현이 같은 pixel assignment를 지지하는지 비교해 신뢰하기 어려운 영역을 찾습니다.

  3. 03 Pixel repair

    전체 pseudo-mask를 다시 만들지 않고, 의견이 다른 pixel만 선택적으로 복원합니다.

  4. 04 Segmentation 학습

    복원된 mask를 supervision으로 사용해 feature-fusion head와 segmentation decoder를 학습합니다.

RESULT

COCO-Val 성능 비교

MethodSupervisionmIoU
WeCLIP+Image-level labels51.80%
Refined pseudo-label methodImage-level labels53.31%

두 결과 모두 COCO-Val 2014 전체 평가셋을 사용했습니다.

고정한 CLIP과 DINOv2 표현, 선택적 pseudo-mask 복원과 self-training으로 구성된 weakly supervised segmentation 구조
Frozen representation, reliability map, 선택적 pixel 복원과 재학습

기여

  • Frozen CLIP과 DINOv2 representation을 이용한 pixel reliability와 selective repair 방법을 설계했습니다.
  • Pseudo-label refinement부터 재학습까지 전체 pipeline을 구현하고 COCO-Val 2014 전체 데이터로 최종 성능을 평가했습니다.

관련 자료

Source code 학습, refinement와 평가 구현