한 줄 요약
WithEveryone은 최대 10명의 참조 신원을 포함한 그룹 이미지 생성을 위한 통합 프레임워크로, 신원 유지를 향상시키며 복사-붙여넣기 아티팩트를 감소시킨다.
핵심 기여도
- ID Representation Forcing을 도입하여 이미지 생성 전에 각 신원에 대한 예측을 학습시킴.
- Layout-Grounded ID Loss(LG-ID Loss)를 제안하여 레이아웃 주석을 기반으로 신원 대응 관계를 직접 지정함.
- 5~10명의 참조 신원을 포함한 그룹 이미지 생성에서 Sim(Tgt) 0.499 (GPT-Image-2 대비 +0.037) 달성.
- 복사-붙여넣기 아티팩트를 0.169에서 0.055로 감소시킴.
핵심 아이디어
기존 그룹 이미지 생성 모델은 여러 참조 신원을 처리할 때 신원 유지를 저하시키고, 신원 간 혼동이나 중복이 발생한다. WithEveryone은 이 문제를 해결하기 위해 ID 토큰을 주소화하고, 레이아웃 주석을 기반으로 신원 대응 관계를 명시적으로 정의한다. 이는 임베딩 기반의 불안정한 신원 매칭을 피하고, 신원 유지를 강화한다.
LG-ID Loss는 생성된 이미지가 아닌 레이아웃 주석을 기반으로 신원을 지도함으로써, 신원 대응 관계를 정확히 정의한다. 이는 기존 방법에서 흔히 발생하는 잘못된 신원 매칭 문제를 해결한다. 또한, ID Representation Forcing는 이미지 생성 전에 각 신원에 대한 예측을 학습시켜, 신원이 공유된 컨텍스트에서 소멸되지 않도록 보장한다.
기술적 접근법
- **ID 토큰 주소화**: 각 참조 신원을 ID 토큰으로 변환하고, 이 토큰을 생성된 인물에 바인딩함.
- **Layout Chain of Thought (Layout CoT)**: 인물 인덱스, 경계 상자, 신원-레이아웃 바인딩, 자세 키포인트를 포함한 구조화된 레이아웃 계획을 자동 생성함.
- **ID Representation Forcing**: 이미지 생성 전에 각 신원에 대한 예측을 학습시켜, 신원이 컨텍스트 내에서 유지되도록 유도함.
- **LG-ID Loss**: 레이아웃 주석을 기반으로 신원 대응 관계를 지정함.
- **Deterministic Renderer**: 레이아웃 계획을 시각적 조건으로 변환함.
주요 결과
- **GPT-Image-2 대비 Sim(Tgt) 0.499 (기존 0.462, +0.037 개선)**
- **복사-붙여넣기 아티팩트 0.055 (기존 0.169, -0.114 감소)**
- **97.3%의 요청 신원을 포함하며, 중복률은 2.8%에 불과**
- **5~10명의 신원을 포함한 그룹 이미지 생성에서 최고 성능**
의의 및 한계
WithEveryone은 신원-레이아웃 바인딩을 명시적으로 정의함으로써, 기존 방법에서 흔히 발생하는 신원 혼동 및 중복 문제를 해결한다. 특히, LG-ID Loss는 임베딩 기반 신원 매칭의 불안정성을 제거하고, 신원 유지를 강화하는 데 기여한다.
그러나, 평가 범위는 단일 벤치마크(210개 샘플)에 제한되며, 참조 신원이 많은 경우 그룹 크기의 추정치는 추세일 뿐 정확한 추정이 아님. 또한, 신원 인식 및 검출 알고리즘의 정확도는 인종 그룹에 따라 달라질 수 있어, 이점은 신원 유지 성능에 영향을 줄 수 있다. 또한, 레이아웃 계획 예측보다 실행에서 오류가 더 많이 발생한다는 점도 한계로 제시된다.
실용적 활용
WithEveryone은 대규모 그룹 이미지 생성이 필요한 산업, 예를 들어, 마케팅, 콘텐츠 제작, 가상 캐릭터 생성 등에 적용 가능하다. 특히, 여러 참조 신원을 포함한 일관되고 시각적으로 매력적인 이미지를 생성해야 하는 상황에서 유용하다.