한 줄 요약
DeQA-Score는 MLLM 기반의 정확한 이미지 품질 점수 회귀를 위해 분포 기반 소프트 라벨과 퓨이델리티 손실을 도입한 모델이다.
핵심 기여도
- **분포 기반 소프트 라벨** 도입: 점수 분포를 직접 이산화하여 정보 손실을 최소화하고 이미지 간 관계를 유지.
- **Thurstone 모델 기반 퓨이델리티 손실** 제안: 다중 데이터셋 간 관계를 학습하여 공동 훈련 효과 향상.
- **KonIQ 데이터셋에서 PLCC 1.3%**, **LIVE-WILD에서 4.6% 개선** 등의 수치적 성능 증명.
- **인간 주석 분포와 유사한 점수 분포 예측** 가능, KL 발산이 낮음.
핵심 아이디어
기존 MLLM 기반 IQA 방법은 점수를 이산화할 때 평균 점수를 one-hot 라벨로 변환하는 방식을 사용하여 정보 손실이 발생하고, 이미지 간 관계를 포착하지 못한다. DeQA-Score는 대신 **점수 분포 자체를 이산화하여 소프트 라벨로 사용**함으로써, **점수 분포의 특성을 보존**하고, **이미지 간 관계를 유지**한다. 예를 들어, Image A와 B가 각각 다른 품질을 가졌음에도 one-hot 라벨은 동일하게 예측할 수 있지만, DeQA-Score는 분포 기반 라벨로 이 관계를 정확히 반영한다.
또한, 다양한 IQA 데이터셋 간 분포 차이를 해결하기 위해 **Thurstone 모델 기반 퓨이델리티 손실**을 도입하여, **데이터셋 내 관계를 학습**하고, **다중 데이터셋 공동 훈련**을 가능하게 한다. 이는 특히 합성 왜곡과 실제 왜곡이 혼합된 데이터셋에서 효과적이다.
기술적 접근법
- **모델 아키텍처**: MLLM 기반, **DeQA-Score** 모델 사용.
- **점수 이산화 방법**: 평균 점수 대신 **점수 분포를 이산화**하여 **소프트 라벨**로 사용.
- **훈련 손실**: **퓨이델리티 손실 (Fidelity Loss)** 도입, Thurstone 모델 기반.
- **데이터셋**: KonIQ, LIVE-WILD, TID2013, CSIQ, PIPAL, AGIQA-3K 등 사용.
- **성능 지표**: **PLCC (Pearson’s Linear Correlation Coefficient)**, **SRCC (Spearman Rank Correlation Coefficient)** 사용.
- **하이퍼파라미터**: 수치는 명시되지 않음.
주요 결과
- **KonIQ 데이터셋에서 PLCC 1.3%**, **LIVE-WILD에서 4.6% 개선** (Q-Align 대비).
- **PIPAL 데이터셋에서 PLCC 0.495 → 0.724** (퓨이델리티 손실 적용 시).
- **AGIQA-3K 데이터셋에서 PLCC 약 0.8**, AI 생성 이미지에서도 높은 일반화 성능.
- **KL 발산** 기준, Q-Align 대비 **인간 주석 분포와 더 유사한 점수 분포 예측**.
의의 및 한계
DeQA-Score는 MLLM이 정확한 수치 점수를 회귀하는 데 기여하며, **점수 분포 예측**이라는 새로운 차원의 IQA를 제시한다. 특히, **다중 데이터셋 간 관계 학습**을 통해 **실제 세계 왜곡 유형에 대한 일반화 능력**을 향상시킨다. 또한, **인간 주관적 평가와 유사한 분포 예측**을 통해 주관적 평가와의 일관성을 높인다.
그러나, **PIPAL 데이터셋**과 같이 모델-처리된 왜곡이 포함된 데이터에서는 **다른 데이터셋 성능이 감소**하는 문제가 있다. 이는 모델-처리 왜곡이 다른 유형의 왜곡과 구조적으로 차이가 크기 때문으로, **더 다양한 왜곡 유형을 포함한 데이터셋**이 필요하다는 한계를 드러낸다.
실용적 활용
DeQA-Score는 **이미지 압축 및 전송**, **스마트폰 사진 처리**, **AI 생성 이미지 품질 평가** 등 다양한 산업 분야에서 활용 가능하다. 특히, **다양한 왜곡 유형을 포함한 대규모 데이터셋**이 필요한 연구 및 제품 개발에 적합하며, **인간 주관 평가와 유사한 수치를 제공**하여 주관적 평가와의 일관성을 유지할 수 있다.