한 줄 요약
RF-Solver와 RF-Edit을 제안하여, Rectified Flow 기반 모델의 인버전 정확도와 편집 성능을 훈련 없이 향상시킨다.
핵심 기여도
- RF-Solver: ODE 해결 과정에서 발생하는 오류를 고차 Taylor 전개를 통해 감소, 인버전 정확도 향상.
- RF-Edit: 인버전 과정에서 추출한 self-attention 특성을 편집 과정에 활용, 구조 보존과 편집 품질 향상.
- FLUX 및 OpenSora와 호환 가능, 추가 훈련 없이 사용 가능.
- 이미지 및 영상 생성, 인버전, 편집에서 베이스라인 대비 우수한 성능 보임.
핵심 아이디어
기존 Rectified Flow 모델은 ODE 해결 과정에서 누적 오류로 인해 인버전 정확도가 낮아, 편집 성능에 제한이 있었다. 이를 해결하기 위해, RF-Solver는 ODE의 정확한 수식을 유도하고, 고차 Taylor 전개를 통해 비선형 성분을 추정함으로써 각 타임스텝에서의 오류를 줄였다. 이는 기존 Euler 방법 대비 더 정밀한 ODE 해결을 가능하게 한다.
RF-Edit은 인버전 과정에서 self-attention의 value 특성(𝒱)을 저장하고, 편집 과정에서 해당 특성을 활용함으로써 원본 구조를 유지하면서도 편집 품질을 향상시킨다. 특히, FLUX와 OpenSora의 DiT 구조를 백본으로 사용하여 이미지와 영상 편집에 모두 적용 가능하다.
기술적 접근법
- **RF-Solver**:
- Rectified Flow ODE의 정확한 수식을 유도.
- 고차 Taylor 전개(2차 사용)를 통해 비선형 성분(네트워크의 적분)을 추정.
- Euler 방법 대신 정밀도 높은 ODE 해결.
- **RF-Edit**:
- 인버전 과정에서 self-attention의 value 특성(𝒱)을 저장.
- 편집 과정에서 해당 특성을 denoising 과정의 대응 위치에 대체.
- FLUX와 OpenSora의 DiT 구조를 백본으로 사용.
- **하이퍼파라미터**:
- Taylor 전개는 2차가 최적, 5개의 feature-sharing step이 편집 성능에 가장 효과적.
주요 결과
- **인버전 정확도**:
- RF-Solver는 기존 방법 대비 MSE, LPIPS, PSNR 등 인버전 지표에서 개선.
- 예: MSE는 기존 대비 30% 감소, PSNR은 2dB 증가.
- **편집 성능**:
- RF-Edit은 Subject Consistency, Motion Smoothness, Aesthetic Quality 등 VBench 지표에서 기존 SOTA 대비 +5%~10% 개선.
- **생성 성능**:
- FID, CLIP Score 등 T2I 생성 지표에서도 기존 모델 대비 개선.
의의 및 한계
- **의의**:
- 기존 Rectified Flow 모델의 인버전 및 편집 성능 한계를 훈련 없이 개선.
- FLUX 및 OpenSora와 호환 가능, 즉각적인 실용성 확보.
- 고차 Taylor 전개와 feature-sharing 기법을 통해 구조 보존과 편집 품질을 동시에 달성.
- **한계**:
- Taylor 전개의 계산 복잡도 증가로 인해 추론 속도 저하 가능성.
- 고차 전개 사용 시 타임스텝 수 감소로 인한 성능 저하 가능성.
- 특정 이미지에 따라 feature-sharing step의 최적값이 달라질 수 있음.
실용적 활용
- **이미지/영상 편집**: 인버전 정확도 향상으로, 디지털 콘텐츠 제작에서의 편집 효율성 향상.
- **AI 생성 콘텐츠(AIGC)**: FLUX 및 OpenSora와의 호환성으로, 생성-편집 통합 워크플로우 구축 가능.
- **멀티모달 생성 모델**: 이미지와 영상 모두에서의 구조 보존 편집 기법으로, 다양한 생성-편집 응용 분야 확장 가능.