한 줄 요약
CW-BASS v2는 DINOv2와 같은 강력한 foundation 모델의 confidence saturation 현상을 고려한 pseudo-label 선택 방법이다.
핵심 기여도
- **saturation-aware pseudo-label selection** 방식 제안: 기존의 단일 기준 대신 teacher의 confidence regime을 동적으로 읽는다.
- **held-out calibration**과 **self-adaptive confidence floor**를 결합한 **one-pass gate** 알고리즘 제시.
- Pascal VOC 1/8에서 UniMatch V2 대비 87.4 mIoU 달성 (87.9 대비 -0.5), ADE20K에서는 +1.5 mIoU 개선.
- 98%의 Pascal 픽셀이 0.95 이상의 confidence를 보이는 경우, adaptive cutoff가 retention mask를 과도하게 확장시킬 수 있음을 분석.
핵심 아이디어
기존의 pseudo-label 선택 방법은 ResNet과 같은 weak teacher를 기반으로 설계되었으나, DINOv2와 같은 foundation 모델은 confidence가 **saturate**되어 기존 필터링 방식이 오히려 성능 저하를 유발한다. CW-BASS v2는 teacher의 confidence regime을 동적으로 분석하는 **saturation-aware** 접근법을 제안한다. 핵심은 **π_kept = Pr[correct | c ≥ τ]**를 held-out slice에서 측정하고, 이 값이 τ 이상일 경우 strict filtering을, 아닐 경우 adaptive floor를 사용하는 **one-pass gate** 알고리즘이다. 이는 teacher의 신뢰도가 아닌 실패 확률을 **측정**하여 결정하기 때문에, 기존의 mIoU 기반 threshold와는 구별된다.
기술적 접근법
- **held-out calibration**: unbiased per-class noise 추정.
- **self-adaptive confidence floor**: retention rate을 1에서 멀어지도록 보장.
- **one-pass gate**: π_kept ≥ τ일 경우 strict filtering, 아닐 경우 adaptive floor 적용.
- **π_kept = Pr[correct | c ≥ τ]**: teacher의 confident set 신뢰도 측정.
- **DINOv2 teacher 6개**를 대상으로 실험.
- **UniMatch V2 baseline**과 비교하며, Pascal VOC 1/8에서 87.4 mIoU, ADE20K에서 +1.5 mIoU 개선.
주요 결과
- **Pascal VOC 1/8**: 87.4 mIoU (UniMatch V2 대비 -0.5).
- **Cityscapes**: UniMatch V2와 0.5 이내.
- **ADE20K**: π_kept ≈ 89%에서 +1.5 mIoU 개선 (single seed 기준).
- **Pascal 데이터셋**: 98%의 픽셀이 0.95 이상의 confidence를 보임.
- **adaptive cutoff**가 retention mask를 과도하게 확장시켜 self-training이 confirmation bias로 이어질 수 있음.
의의 및 한계
CW-BASS v2는 foundation 모델의 confidence saturation 문제를 해결하며, 기존 semi-supervised 방법의 성능을 유지하거나 개선한다. 특히, **π_kept 기반의 one-pass gate**는 teacher의 신뢰도를 측정하여 결정하기 때문에, 기존의 경험적 threshold와는 차별화된다. 그러나, **single seed 기준**에서의 개선이 제한적일 수 있으며, **held-out calibration**이 추가적인 데이터 분할을 요구하므로, 데이터가 제한된 환경에서는 적용이 어려울 수 있다.
실용적 활용
- **foundation 모델 기반의 semi-supervised learning**에서 pseudo-label 신뢰도를 정확히 평가할 수 있는 방법으로 활용 가능.
- **DINOv2와 같은 강력한 teacher 모델**을 사용하는 시맨틱 세그멘테이션 작업에서 특히 유용.
- **low-resource 환경**에서, 적은 수의 labeled 데이터로도 성능을 유지할 수 있는 알고리즘 개발에 기여.