한 줄 요약
유리 표면 반사 제거를 위한 물리 기반 시뮬레이션과 확산 모델 기반 비디오 반사 제거 프레임워크를 제안한다.
핵심 기여도
- **S2R-Synthesis**: 물리 기반 증강과 학습된 비디오 확산 렌더러를 활용한 반사-무반사 비디오 생성 파이프라인.
- **S2R-Removal**: 확산 모델 기반으로 단일 단계에서 반사 제거를 수행하며, 기존 비확산 모델보다 빠른 추론 속도를 보임.
- **S2R-Bench**: 첫 번째 비디오 반사 제거 벤치마크로, 정량적 평가와 인간 인지 평가를 지원.
- **28.84 dB PSNR, 0.8594 SSIM** 성능 기록.
핵심 아이디어
기존 단일 이미지 반사 제거는 비디오 환경에서 시간적 일관성과 데이터 부족으로 한계가 있었다. 본 연구는 **폐루프 프레임워크**를 제안하며, **S2R-Synthesis**를 통해 반사와 무반사 비디오를 대규모로 생성하고, 이를 기반으로 **S2R-Removal**를 학습한다. 이 모델은 **reflection-aware latent adaptation**과 **pixel-geometric refinement**를 결합하여 단일 단계에서 반사 제거를 수행한다.
**S2R-Synthesis**는 **Physics-Grounded Augmentation (PGA)**를 통해 유리의 거칠기, 두께, 반사율에 따른 효과를 정확히 재현하며, **video diffusion renderer**를 사용해 시간적 일관성을 유지한 반사 비디오를 생성한다. 이는 기존 RGB-공간 혼합이나 프레임 단위 확산 모델보다 더 정확하고 제어 가능한 반사 시뮬레이션이 가능하다는 점에서 혁신적이다.
기술적 접근법
- **S2R-Synthesis**:
- **Physics-Grounded Augmentation (PGA)**: 유리의 거칠기, 두께, 반사율에 따른 효과를 시뮬레이션.
- **Video Diffusion Renderer**: 학습된 이미지 확산 모델에서 시간적 일관성을 계승한 렌더러로, 반사 비디오 생성.
- **S2R-Removal**:
- **Stage I**: 반사 강도 감독을 통한 **reflection-aware latent adaptation**.
- **Stage II**: **ℒ_rec, ℒ_ssim, ℒ_depth** 손실 함수를 사용한 **pixel-geometric refinement**.
- 단일 **denoising step**으로 반사 제거.
- **S2R-Bench**:
- **S2R-Ref**: 무반사 정답을 포함한 정량 평가 데이터.
- **S2R-Real**: 실제 반사 비디오로 인간 인지 평가 수행.
주요 결과
- **S2R-Bench**에서 **28.84 dB PSNR, 0.8594 SSIM** 기록.
- **Stage-I**에서 PSNR 27.00 dB → 27.71 dB, SSIM 0.8348 → 0.8430 개선.
- **Stage-II**에서 ℒ_rec, ℒ_ssim, ℒ_depth 추가로 최종 성능 달성.
- **비확산 기반 베이스라인 대비 1.6× 가속**.
의의 및 한계
본 연구는 **비디오 반사 제거 분야의 첫 번째 통합 프레임워크**로, 데이터 생성, 모델 학습, 평가를 모두 포함하며, **확산 모델을 활용한 시간적 일관성 있는 제거**를 가능하게 한다. 특히, **S2R-Synthesis**는 반사 시뮬레이션의 현실성과 제어 가능성을 동시에 확보한 점에서 학술적 가치가 높다.
하지만, **S2R-Real** 데이터셋의 **인간 평가 점수는 명시되지 않음**. 또한, **실제 세계 환경에서의 일반화 가능성**은 추가 실험을 통해 검증이 필요하다.
실용적 활용
본 연구는 **컴퓨터 비전**, **영상 품질 향상**, **영상 보안**, **자율 주행** 등에서 유리 표면 반사 제거에 활용 가능하다. 특히, **실시간 반사 제거**가 필요한 산업 현장에서 **빠른 추론 속도**와 **시간적 일관성**을 요구하는 시스템에 적합하다.