한 줄 요약
HQ-Edit는 GPT-4V와 DALL-E 3를 활용한 20만 개의 고해상도 이미지 편집 데이터셋으로, 기존 모델보다 편집 정확도를 12.3% 향상시킨다.
핵심 기여도
- GPT-4V와 DALL-E 3를 활용한 자동화된 데이터셋 생성 파이프라인 제안.
- Alignment (편집 지시와 이미지 일치도)와 Coherence (편집 이미지의 일관성)라는 두 개의 GPT-4V 기반 평가 지표 제안.
- 900×900 픽셀 해상도의 고해상도 이미지와 20만 개의 상세한 편집 지시어 포함.
- InstructPix2Pix 모델을 HQ-Edit로 fine-tuning했을 때 Alignment 지표에서 기존 최고 성능을 12.3% 개선.
핵심 아이디어
기존 편집 데이터셋은 GPT-3와 Stable Diffusion 1.5 등 낡은 모델을 사용해 해상도와 정확도가 낮았으며, 인간 피드백에 의존해 확장성이 제한적이었다. 본 연구는 최신 기초 모델인 GPT-4V와 DALL-E 3를 활용해 편집 데이터셋을 자동 생성함으로써 이 문제를 해결한다. 특히, DALL-E 3를 통해 생성된 이미지 쌍(diptych)을 기반으로 입력-출력 이미지의 정밀한 정렬을 보장하는 후처리 과정을 도입했다. 이는 기존 Prompt-to-Prompt 방식보다 편집 영역 외부의 일관성을 향상시키는 데 기여한다.
기술적 접근법
- **데이터 생성 파이프라인**: GPT-4를 사용해 온라인에서 수집한 seed triplet(입력/출력 이미지 설명 + 편집 지시)을 10만 개로 확장.
- **DALL-E 3 기반 이미지 생성**: GPT-4가 생성한 상세한 편집 지시를 기반으로 DALL-E 3가 900×900 픽셀 해상도의 이미지 쌍을 생성.
- **후처리 단계**:
- **평가 지표**: GPT-4V를 활용한 Alignment (편집 지시와 일치도)와 Coherence (편집 이미지 일관성) 지표를 제안.
1) 이미지 쌍 분리 및 왜곡 보정 (Warp).
2) GPT-4V를 활용한 지시어 재작성 (Rewrite).
3) 역편집 지시 생성 (Inverse).
4) 왜곡된 이미지 필터링 (Filter).
주요 결과
- HQ-Edit로 fine-tuning한 InstructPix2Pix 모델은 Alignment 지표에서 기존 최고 성능을 12.3% 개선.
- Coherence 지표에서는 5.64% 향상.
- DALL-E 3로 생성된 RAW 이미지만 사용할 경우 Alignment는 향상되지만 Coherence는 저하됨.
- 후처리 기법 (Rewrite, Warp, Inverse)을 적용하면 Alignment 11.79% 향상, Coherence 0.94% 향상.
- Filtering은 Alignment 3.6% 향상, Coherence 1.4% 감소.
의의 및 한계
HQ-Edit는 기존 인간 주도 데이터셋의 한계를 극복한 첫 대규모 자동 생성 편집 데이터셋으로, GPT-4V와 DALL-E 3의 강력한 생성 능력을 활용해 편집 정확도와 일관성을 동시에 향상시킨다. 특히, Alignment와 Coherence 지표를 통해 편집 품질을 정량적으로 평가할 수 있는 새로운 기준을 제시한다. 그러나 DALL-E 3의 API 기반 접근으로 모델 가중치에 직접 접근하지 못한 점이 한계이며, 일부 후처리 과정에서 이미지 왜곡이 발생할 수 있다.
실용적 활용
HQ-Edit는 디지털 콘텐츠 제작, 광고, 영화 산업에서의 자동 이미지 편집 모델 개발에 활용 가능하다. 특히, GPT-4V와 DALL-E 3의 API를 활용한 대규모 데이터셋 생성 방식은 편집 모델의 훈련 데이터 확보를 효율화할 수 있다.