한 줄 요약
InstanceDiffusion은 인스턴스 수준의 위치와 속성 제어를 가능하게 하는 텍스트-이미지 생성 모델로, COCO 데이터셋에서 기존 모델 대비 20.4% AP<sub>50</sub><sup>box</sup> 및 25.4% IoU 개선을 달성했다.
핵심 기여도
- UniFusion 블록을 통해 다양한 인스턴스 조건(포인트, 스케치, 바운딩 박스, 마스크)을 통합하여 텍스트-이미지 생성 모델에 인스턴스 수준 조건을 주입.
- ScaleU 블록을 통해 UNet의 스킵 연결 및 백본 특징을 재조정하여 이미지 정확도를 향상.
- Multi-instance Sampler를 도입하여 다중 인스턴스 간 정보 누수를 감소.
- COCO val 데이터셋에서 GLIGEN 대비 20.4% AP<sub>50</sub><sup>box</sup> 및 DenseDiffusion 대비 25.4% IoU 개선.
핵심 아이디어
기존 텍스트-이미지 생성 모델은 전체 이미지에 대한 조건만 제공할 수 있었으나, InstanceDiffusion은 각 인스턴스의 위치와 속성을 개별적으로 지정할 수 있도록 확장했다. 이는 UniFusion, ScaleU, Multi-instance Sampler 세 가지 주요 모듈을 통해 실현된다. UniFusion은 다양한 인스턴스 조건(예: 바운딩 박스, 마스크)을 동일한 특징 공간으로 투영하고, 텍스트 기술과 결합하여 시각 토큰에 주입한다. ScaleU는 UNet의 스킵 연결과 백본 특징을 재조정하여 인스턴스 조건을 정밀하게 반영하도록 한다. Multi-instance Sampler는 여러 인스턴스 간의 조건 혼동을 줄이며, 생성 품질을 향상시킨다. 이 접근법은 기존 연구에서 단일 조건 형식만 다루는 것과 달리, 다양한 인스턴스 조건을 유연하게 처리할 수 있다는 점에서 차별화된다.
기술적 접근법
- **UniFusion**: 다양한 인스턴스 조건(포인트, 스케치, 바운딩 박스, 마스크)을 동일한 특징 공간으로 투영하고, 텍스트 기술과 결합하여 시각 토큰에 주입.
- **ScaleU**: UNet의 스킵 연결 및 백본 특징을 재조정하여 인스턴스 조건을 정밀하게 반영.
- **Multi-instance Sampler**: 다중 인스턴스 간의 정보 누수를 감소시키는 샘플링 전략.
- **데이터셋**: 기존 텍스트-이미지 데이터셋 대신, 인스턴스 수준의 위치와 텍스트 캡션을 포함한 새로운 데이터셋을 생성.
- **하이퍼파라미터**: MIS 비율이 36% 이하일 때 가장 효과적임을 실험적으로 확인.
주요 결과
- **COCO val 데이터셋**:
- 바운딩 박스 입력에서 GLIGEN 대비 20.4% AP<sub>50</sub><sup>box</sup> 개선.
- 마스크 입력에서 DenseDiffusion 대비 25.4% IoU 개선.
- 인스턴스 색상 정확도에서 25.2 포인트, 질감 정확도에서 9.2 포인트 향상.
- **FID 점수**: Multi-instance Sampler 적용 시 FID 점수가 감소하여 이미지 품질 향상 확인.
의의 및 한계
InstanceDiffusion은 텍스트-이미지 생성 모델에서 인스턴스 수준의 정밀 제어를 가능하게 하여, 디자인, 데이터 증강 등 다양한 분야에서 활용 가능성을 열었다. 특히, 다양한 인스턴스 조건 형식을 통합적으로 처리하는 모델 구조는 기존 연구와 비교해 더 유연하고 효율적인 접근법을 제시한다. 그러나, 대규모 인스턴스-이미지 쌍 데이터셋이 필요하며, 현재는 자동 생성된 데이터셋에 의존하고 있어, 실제 인스턴스 데이터에 대한 일반화 능력은 추가 연구가 필요하다. 또한, 포인트나 스케치 조건에 대한 평가 지표는 본 연구에서 처음 도입된 것으로, 더 많은 연구가 필요하다.
실용적 활용
InstanceDiffusion은 디자인 도구, 게임 콘텐츠 생성, 데이터 증강 등에서 유용하게 활용될 수 있다. 예를 들어, 사용자가 이미지에 특정 객체를 정밀하게 삽입하거나, 기존 객체를 유지하면서 새로운 객체를 추가하는 작업이 가능하다. 이는 디지털 콘텐츠 제작 과정에서의 효율성과 창의성을 동시에 향상시킬 수 있다.