한 줄 요약
Poly-OPD는 서로 다른 텍스트-이미지 생성 모델의 강점을 하나의 학생 모델로 통합하는 이질적 온-포로시 디스틸레이션 프레임워크이다.
핵심 기여도
- 이질적 교사 모델(FLUX.1-dev, Z-Image)의 강점을 2.5B SD3.5-Medium 학생 모델로 통합.
- GenEval 점수 67.3 → 73.3 (6.0 상승), DrawBench HPSv3 9.34 → 11.35 (2.01 상승).
- 이질적 라틴 공간을 연결하는 pixel bridge와 DINOv2 공간에서의 감독을 도입.
- gradient compatibility 기반의 attention LoRA 공유와 FFN 어댑터 분리 전략 제시.
핵심 아이디어
기존 디스틸레이션은 동일한 라틴 공간을 가정하지만, Poly-OPD는 이질적 라틴 공간을 가진 교사 모델을 처리한다. 학생이 생성한 이미지를 픽셀 공간으로 디코딩한 뒤, 선택된 교사의 인코더로 재인코딩하고 해당 교사의 노이즈 스케줄에 맞춰 노이즈 레벨을 조정하여 "교사의 수정"을 얻는다. 이는 학생의 실제 샘플에 기반한 온-포로시 감독(on-policy supervision)을 가능하게 한다. 감독은 DINOv2의 고정된 특징 공간에서 이루어져, 라틴 공간 불일치를 극복한다.
또한, attention LoRA는 교사 간 공유되지만, FFN 어댑터는 교사별로 분리되어 간섭을 최소화한다. 이는 gradient compatibility 분석을 통해 결정되며, 학생이 단일 백본에서 여러 능력을 전환할 수 있도록 한다.
기술적 접근법
- **Pixel Bridge**: 학생 이미지를 픽셀 공간으로 디코딩 → 선택된 교사의 인코더로 재인코딩 → 노이즈 레벨을 교사의 스케줄에 맞춰 조정.
- **DINOv2 감독**: 감독은 고정된 DINOv2 특징 공간에서 이루어져, 라틴 공간 불일치를 극복.
- **Capability-Selectable Adapters**: attention LoRA는 공유, FFN 어댑터는 교사별 분리.
- **Gap-Aware Sampling**: 학생-교사 간 잔차가 큰 범주에 더 많은 샘플링을 할당.
주요 결과
- GenEval: 67.3 → 73.3 (+6.0), DrawBench HPSv3: 9.34 → 11.35 (+2.01).
- FLUX.1-dev와 Z-Image의 강점을 2.5B SD3.5-Medium 학생 모델에 통합.
- 단일 백본에서 어댑터 교체로 능력 전환 가능.
의의 및 한계
Poly-OPD는 이질적 라틴 공간을 가진 교사 모델을 통합하는 첫 번째 온-포로시 디스틸레이션 프레임워크로, 기존의 라틴-스페이스 기반 디스틸레이션이 적용 불가능한 상황에서 유의미한 성능 향상을 보인다. 또한, 어댑터 기반의 능력 전환은 추론 시 비용을 낮추는 실용적 가치를 제공한다.
그러나, 학생 모델이 교사보다 작기 때문에 일부 복잡한 능력은 완전히 재현되지 않을 수 있으며, 어댑터 기반 전환은 학습 시 교사 간 간섭을 줄이는 데 효과적이지만, 모든 상황에서 최적일 수는 없다는 한계가 있다.
실용적 활용
Poly-OPD는 텍스트-이미지 생성 모델을 활용하는 클라우드 서비스, 디자인 도구, 콘텐츠 생성 플랫폼 등에서 여러 모델의 강점을 하나의 모델로 통합하여 비용과 복잡도를 줄이는 데 활용 가능하다. 특히, 어댑터 기반 전환은 실시간 추론 시 유연한 능력 전환을 가능하게 하며, 모델 관리 및 배포에 유리하다.