한 줄 요약
SEA-RAFT는 기존 RAFT에 비해 정확도와 효율성을 동시에 향상시킨 광학 흐름 추정 모델로, Spring 벤치마크에서 EPE 3.69, 1px 0.36 성능을 달성하며 2.3× 빠른 처리 속도를 보인다.
핵심 기여도
- 새로운 **mixture of Laplace loss**를 도입하여 일반화 성능을 향상시킴.
- **직접 예측된 초기 흐름(initial flow)**을 도입해 반복 정제(iterative refinement) 속도를 22.9% 개선.
- **rigid-motion pre-training**을 통해 TartanAir 데이터셋을 사용한 사전 학습으로 17.8%의 1px 오류율 감소.
- **ResNet 기반 encoder**와 **ConvNext 기반 RNN**으로 모델 구조를 단순화하고 확장성 향상.
핵심 아이디어
SEA-RAFT는 RAFT 기반 광학 흐름 모델을 개선하기 위해 세 가지 주요 아이디어를 제시한다. 첫째, 기존의 L1 손실 대신 **mixture of Laplace loss**를 도입하여 정답 흐름의 로그-우도(log-likelihood)를 최대화함으로써 모델이 모호한 경우에 과적합되는 문제를 완화한다. 둘째, **initial flow를 직접 예측**함으로써 반복 정제 과정에서 필요한 반복 횟수를 줄여 처리 속도를 향상시킨다. 셋째, **rigid-motion pre-training**을 통해 TartanAir 데이터셋에서 카메라 운동에 의한 정적인 흐름을 학습함으로써 일반화 능력을 높인다. 이는 특히 KITTI와 Spring 데이터셋에서 cross-dataset 성능을 향상시키는 데 기여한다.
기술적 접근법
- **모델 구조**: ResNet-18/34를 기반으로 한 feature/context encoder 사용.
- **RNN**: ConvNext 블록으로 구성된 간단한 RNN 사용.
- **손실 함수**: Mixture of Laplace loss를 사용하여 정답 흐름의 로그-우도 최대화.
- **학습 단계**:
- TartanAir에서 300k 스텝 사전 학습 (batch size 32, 480×640 해상도, learning rate 4×10⁻⁴).
- FlyingChairs (100k 스텝, batch size 16, 368×496, learning rate 2.5×10⁻⁴), FlyingThings3D (120k 스텝, batch size 32, 432×960, learning rate 4×10⁻⁴)에서 학습.
- Sintel, KITTI, HD1K 데이터셋에서 fine-tuning 수행.
- **모델 버전**: SEA-RAFT(S), (M), (L)로 구분. (S)는 ResNet-18 6층, (M)은 ResNet-34 13층, (L)은 (M) 기반 12회 반복.
주요 결과
- **Spring 데이터셋**: SEA-RAFT(M)은 EPE 3.69, 1px 0.36 성능을 달성해 기존 최고 성능 대비 22.9%와 17.8% 개선.
- **KITTI**: Fl-epe 3.62, Fl-all 12.9 성능, 기존 최고 성능 대비 10.6% 개선.
- **Sintel**: clean pass에서 19.9% 개선, final pass에서 4.2% 개선.
- **처리 속도**: SEA-RAFT(S)는 1080p 이미지 처리 시 21fps, 기존 RAFT 대비 3× 빠름.
- **모델 크기**: SEA-RAFT(S)는 기존 최고 성능 모델 대비 11× 작음.
의의 및 한계
SEA-RAFT는 RAFT 기반 광학 흐름 모델에서 정확도와 효율성을 동시에 향상시킨 첫 사례로, 특히 고해상도 이미지 처리에서 실용적 가치가 높다. 또한, ResNet과 ConvNext 블록을 활용한 모델 구조는 확장성과 유지보수성 향상에 기여한다. 그러나 Sintel final pass에서 일부 기존 모델보다 성능이 낮은 점은 한계로 지적된다. 이는 훈련 데이터 다양성 부족 또는 특정 데이터셋에 대한 과적합 가능성과 관련이 있을 수 있다.
실용적 활용
SEA-RAFT는 고해상도 영상 처리가 필요한 산업 분야(예: 자율주행, 드론, 영상 인코딩)에서 광학 흐름 추정을 빠르고 정확하게 수행할 수 있는 기반 기술로 활용 가능하다. 또한, 연구 분야에서는 다양한 광학 흐름 모델의 성능 비교 및 새로운 모듈 도입에 있어 표준 벤치마크 역할을 할 수 있다.