한 줄 요약
TransNormal-2는 VAE 재구성 오류를 해결한 정밀 법선 추정 모델로, ClearGrasp에서 4.2°의 MAE 감소를 달성.
핵심 기여도
- VAE 디코더의 경계 오류를 줄이기 위해 inverse rendering self-consistency, von Mises-Fisher loss, wavelet edge-aware regularization을 결합.
- Geometric Refinement Module (GRM)을 도입하여 RGB 정보를 기반으로 경계 오류를 보정.
- ClearGrasp와 ClearPose 데이터셋에서 기존 최고 기준 대비 각각 4.2°, 3.1°의 MAE 감소.
- MoGe-2 모델 대비 1.4%의 정답 라벨만 사용하면서 모든 8개 지표에서 동일 또는 우수한 성능.
핵심 아이디어
기존 diffusion 모델은 VAE의 8× 공간 압축으로 인해 경계에서 법선 추정 오류가 발생하며, 이는 정확도에 큰 영향을 미친다. TransNormal-2는 이 문제를 해결하기 위해 두 가지 접근을 결합한다. 첫째, VAE 디코딩 후에도 기하학적 일관성을 유지하도록 inverse rendering self-consistency와 von Mises-Fisher angular loss를 사용하여 loss를 설계한다. 둘째, GRM을 통해 RGB 이미지 정보를 활용해 경계 오류를 보정하면서 전체 예측을 재작성하지 않는다. 이는 기존의 loss 기반 접근과 달리, 공간적 일관성을 유지하면서 정밀도를 향상시킨다.
기술적 접근법
- **모델 기반**: FLUX.2 기반의 rectified-flow framework를 사용.
- **Loss 함수**: latent MSE 외에도 inverse rendering self-consistency, von Mises-Fisher angular loss, wavelet edge-aware regularization을 결합.
- **모듈**: Geometric Refinement Module (GRM)을 통해 RGB 정보를 기반으로 residual correction 적용.
- **데이터셋**: ClearGrasp, ClearPose, 일반 장면 벤치마크 사용.
- **하이퍼파라미터**: 8× 공간 압축 VAE 사용, 1.4%의 정답 라벨만 사용.
주요 결과
- ClearGrasp 데이터셋에서 기존 최고 기준 대비 4.2°의 MAE 감소.
- ClearPose 데이터셋에서 3.1°의 MAE 감소.
- 일반 장면 벤치마크에서 8개 지표 모두 MoGe-2 모델을 동일 또는 초과하면서 1.4%의 정답 라벨만 사용.
의의 및 한계
TransNormal-2는 VAE 재구성 오류를 정밀하게 해결함으로써, 기존 diffusion 모델의 한계를 극복한 사례로, 법선 추정 분야에서 중요한 기여를 한다. 특히, GRM과 geometry-aware loss는 경계 오류를 줄이는 데 효과적이며, 라벨 데이터를 최소화하면서도 높은 정확도를 유지하는 점에서 실용적 가치가 크다. 그러나, 모델이 특정 유형의 투명 물체에만 효과적일 수 있으며, 더 다양한 환경에서의 일반화 능력은 추가 연구가 필요하다.
실용적 활용
TransNormal-2는 로봇 비전, 3D 재구성, AR/VR 등에서 정밀 법선 추정이 필요한 분야에 적용 가능하다. 특히, 라벨 데이터가 제한된 상황에서 유용하며, 투명 물체 처리 능력은 산업 자동화 및 의료 영상 분석에 기여할 수 있다.