한 줄 요약
FLAT은 이미지와 텍스트를 1D 연속 시퀀스로 변환하여 생성과 검색을 통합하는 다중모달 학습 프레임워크로, T2I GenEval 83.1, MS-COCO BLEU-4 40.5 등 SOTA 성능을 달성한다.
핵심 기여도
- FLAT은 T2I 및 I2T 생성과 검색을 통합하는 **공유된 다중모달 인코더**와 **양방향 생성 손실**을 사용하여 학습한다.
- **1D 연속 시퀀스 공간**으로 이미지와 텍스트를 매핑하고, **prefix-K 토큰에 대한 중첩 드롭아웃**을 적용하여 동적 출력 길이를 지원한다.
- 단일 사전 학습 단계에서 T2I GenEval 71.1, MS-COCO Recall@5 69.1 (I2T) 및 64.6 (T2I) 성능을 달성한다.
- **GenEval 83.1**, **BLEU-4 40.5**, **CIDEr 138.6** 등 다중 작업에서 SOTA 수준의 성능을 보인다.
핵심 아이디어
FLAT은 기존의 다중모달 학습과 생성을 분리한 방식의 한계를 극복하기 위해, **공유된 인코더**와 **양방향 생성 손실**을 결합한 통합 학습 프레임워크를 제안한다. 기존 모델은 CLIP, DINO, Stable Diffusion 등에서 사용되는 **고정된 인코딩**이 생성 성능을 제한하는 문제를 해결하기 위해, FLAT은 생성과 검색 모두에 활용 가능한 **선형 보간 가능한 임베딩 공간**을 학습한다. 이는 **contrastive alignment**와 **양방향 생성 손실**을 결합하여, **구별적 의미 기술자**와 **생성 조건**으로서의 역할을 동시에 수행하도록 설계되었다.
기술적 접근법
- **FLAT**은 이미지와 텍스트를 **1D 연속 시퀀스 공간**으로 매핑하는 **공유된 다중모달 인코더**를 사용한다.
- **prefix-K 토큰에 대한 중첩 드롭아웃**을 적용하여, **동적 출력 길이**를 지원하며, 추론 시 유연한 길이 선택이 가능하다.
- **contrastive 손실**과 **양방향 생성 손실**(I2T 및 T2I)을 결합하여, **T2I 및 I2T 생성**과 **다중모달 검색**을 동시에 학습한다.
- **GenEval**, **BLEU-4**, **CIDEr**, **Recall@5** 등의 지표를 사용한 실험에서 SOTA 성능을 달성한다.
주요 결과
- **T2I GenEval**: 83.1 (SOTA 수준, 기존 베이스라인 대비 +12.0)
- **MS-COCO I2T**: BLEU-4 40.5, CIDEr 138.6
- **MS-COCO Recall@5**: I2T 86.8, T2I 75.8
- **Flickr30K Recall@5**: I2T 98.3, T2I 93.6
- **ImageNet 선형 프로빙**: 81.8 (생성 임베딩 공간 기준 최고 성능)
의의 및 한계
FLAT은 기존의 다중모달 학습과 생성을 분리한 방식의 한계를 극복하고, **단일 사전 학습 단계**로 다양한 작업을 처리할 수 있는 **유연한 다중모달 프레임워크**를 제시한다. 특히, **선형 보간**, **잠재 공간 산술**, **제로샷 복합 검색** 등의 기능을 통해 임베딩 공간의 **기하학적 구조**를 활용한 새로운 응용이 가능하다. 그러나, FLAT은 **다국어 프롬프트**나 **비디오 모달**에 대한 평가가 부족하며, **추가 실험**이 필요하다.
실용적 활용
FLAT은 이미지-텍스트 생성, 검색, 캡션 생성 등 다양한 다중모달 작업에 적용 가능하며, **유연한 길이 조절**과 **제로샷 생성** 기능을 통해 **콘텐츠 생성**, **검색 엔진**, **멀티모달 인터페이스** 개발에 활용될 수 있다.