한 줄 요약
Infinity는 비트단위 토큰 예측을 기반으로 고해상도 이미지 생성 성능을 획기적으로 향상시킨 오토회귀 모델이다.
핵심 기여도
- Infinity는 비트단위 토큰 예측 프레임워크를 도입하여, 토크나이저의 어휘 크기를 이론적으로 무한대로 확장(2⁶⁴)함으로써 기존 오토회귀 모델의 한계를 극복.
- Bitwise Infinite-Vocabulary Classifier (IVC)와 Bitwise Self-Correction 메커니즘을 통해 이미지 재구성 품질을 ImageNet-256 기준 0.87 → 0.33 개선.
- GenEval, ImageReward, HPSv.2.1 벤치마크에서 SD3 대비 +0.11, +0.09, +1.4 개선, 66% 승률 달성.
- 1024×1024 이미지 생성 속도 0.8초로, SD3-Medium 대비 2.6× 빠르게 처리.
핵심 아이디어
Infinity는 기존 오토회귀 모델에서 사용되는 인덱스 기반의 이산 토큰 대신, 비트단위 토큰을 도입함으로써 토크나이저의 정밀도를 획기적으로 높였다. 기존 토크나이저는 어휘 크기 제한으로 인해 고해상도 이미지 생성 시 세부 정보 손실이 발생했으나, Infinity는 어휘 크기를 2⁶⁴로 확장하여 이론적으로 무한한 표현력을 가능하게 했다. 이는 기존 이산 토크나이저가 달성할 수 없는 수준의 재구성 능력을 제공한다. 또한, Bitwise Self-Correction 메커니즘을 통해 훈련 중 일부 비트를 무작위로 뒤집고 잔차 특성을 재-퀀티제이션함으로써 예측 오류를 시뮬레이션하고, 이를 통해 시스템 스스로 오류를 수정하는 능력을 부여했다. 이는 오토회귀 모델의 훈련-테스트 불일치 문제를 완화하는 데 기여한다.
기술적 접근법
- **Bitwise Visual Tokenizer**: 기존 이산 토큰 대신 64비트 이진 벡터를 사용하여 토크나이저의 어휘 크기를 2⁶⁴로 확장.
- **Bitwise Infinite-Vocabulary Classifier (IVC)**: 비트단위 예측을 통해 대규모 어휘 학습 가능.
- **Bitwise Self-Correction**: 훈련 시 30% 비트를 무작위로 뒤집고 잔차를 재-퀀티제이션하여 예측 오류를 시뮬레이션.
- **RoPE2d + Learnable Scale Embeddings**: 다양한 해상도와 비율의 이미지 처리를 위해 2D 구조를 유지하는 RoPE2d와 스케일 임베딩을 결합.
- **Decoding Strategy**: Bitwise Self-Correction을 통해 초기 스케일에서도 강력한 CFG 적용 가능. 다양한 디코딩 방법 비교 후 최적 전략 채택.
주요 결과
- **GenEval**: 0.62 → 0.73 (+0.11), **ImageReward**: 0.87 → 0.96 (+0.09), **HPSv2.1**: 30.9 → 32.3 (+1.4), **인간 평가 승률**: 66%.
- **1024×1024 이미지 생성 속도**: 0.8초, SD3-Medium 대비 2.6× 빠름.
- **ImageNet-256 재구성 점수**: 0.87 → 0.33 개선.
- **모델 크기 동일 조건에서 추론 속도 향상**: 2.6× 가속.
의의 및 한계
Infinity는 오토회귀 모델이 확장성과 세부 표현력을 동시에 갖출 수 있음을 입증하며, 이산 생성 모델의 한계를 극복하는 새로운 방향을 제시한다. 특히, 비트단위 토크나이저와 IVC의 결합은 기존 이산 토크나이저가 달성할 수 없는 수준의 재구성 능력을 제공하며, Bitwise Self-Correction은 훈련-테스트 불일치 문제를 완화한다. 그러나, 2⁶⁴ 크기의 어휘를 학습하는 데 필요한 계산 자원과 메모리 요구량은 여전히 큰 과제이며, 실제 대규모 배포 시 인프라적 제약이 있을 수 있다. 또한, 비트단위 토크나이저의 복잡성은 모델 해석성과 디버깅 난이도를 높일 수 있다.
실용적 활용
Infinity는 고해상도 텍스트-이미지 생성이 필요한 디지털 콘텐츠 제작, 광고, 게임 개발 등 다양한 산업 분야에 적용 가능하다. 특히, 빠른 추론 속도와 높은 생성 품질을 요구하는 실시간 이미지 생성 시스템에 적합하며, 대규모 이미지 생성 작업을 효율적으로 처리할 수 있다. 또한, 연구 분야에서는 이산 생성 모델의 확장성과 표현력 향상을 위한 기초 연구에 기여할 수 있다.