한 줄 요약
VISA는 대규모 언어 모델을 활용해 암묵적 텍스트 쿼리에 기반한 비디오 객체 분할을 수행하는 새로운 ReasonVOS 태스크를 제안한다.
핵심 기여도
- 새로운 태스크 Reasoning Video Object Segmentation (ReasonVOS)를 제안, 암묵적 텍스트 쿼리에 기반한 객체 분할을 목표로 함.
- VISA 모델을 제안, Text-guided Frame Sampler (TFS)와 SAM decoder를 결합하여 장기 비디오 특징과 텍스트를 통합.
- ReVOS 데이터셋을 구축, 1,042개 비디오에서 35,074개의 instruction-mask sequence 포함.
- 8개 데이터셋에서 실험, Reasoning Segmentation과 Referring Segmentation 모두에서 효과적임을 보임.
핵심 아이디어
기존 VOS는 명시적 쿼리(카테고리, 마스크, 짧은 문장)에 의존하여 복잡한 추론이 필요한 분할에 제한이 있었다.
VISA는 암묵적 텍스트 쿼리(예: “내가 가장 좋아하는 컵”)를 처리할 수 있도록 설계되었으며, 이는 세계 지식과 비디오 맥락을 기반으로 추론을 요구한다.
TFS 모듈을 통해 텍스트 쿼리에 관련된 프레임을 선택함으로써 처리해야 할 시각 토큰 수를 줄이고, LLM을 통해 추론을 수행한 후 SAM decoder로 분할 마스크를 생성한다.
이러한 접근은 장기 비디오 이해와 정확한 객체 추적을 결합하여, Embodied AI 개발에 필수적인 능력을 구현한다.
기술적 접근법
- **Text-guided Frame Sampler (TFS)**: 텍스트 쿼리에 기반해 관련 프레임을 선택, 처리 토큰 수를 줄임.
- **Multi-modal LLM**: 선택된 프레임과 텍스트를 동시에 처리, 추론 및 분할을 위한 `< < Seg > >` 토큰 생성.
- **SAM decoder**: `< < Seg > >` 토큰의 임베딩을 사용해 분할 마스크 생성.
- **Object Tracker**: 분할 마스크를 양방향으로 전파하여 전체 프레임 분할.
- **Training**: 텍스트 생성 손실 (ℒ_txt)과 분할 손실 (ℒ_mask)을 결합한 end-to-end 학습.
- **Reference Sampling Strategies**: Global/Local 샘플링 전략을 통해 장기 정보를 활용.
주요 결과
- ReVOS 데이터셋에서 VISA는 Reasoning Segmentation 성능이 3.8% 향상됨 (Instruction Tuning 효과).
- Referring Segmentation 성능은 3.3% 감소 없이 유지됨.
- Image 데이터셋 없이 학습 시 성능이 16.7% 감소, Image 데이터셋의 중요성 강조.
- 8개 데이터셋에서 실험, 이미지 및 비디오 도메인에서 모두 효과적임을 보임.
의의 및 한계
VISA는 세계 지식 기반 추론과 장기 비디오 이해를 결합한 첫 번째 모델로, Embodied AI 개발에 기여한다.
ReVOS 데이터셋은 기존 Referring VOS 데이터셋과 달리 암묵적 텍스트를 포함하여 추론 능력을 평가할 수 있는 새로운 기준을 제시한다.
한계로는 텍스트 쿼리가 복잡할 경우 추론 오류가 발생할 수 있으며, 장기 비디오 처리 시 계산 비용이 높다는 점이 있다.
실용적 활용
VISA는 로봇이 동적 환경에서 사용자 지시에 따라 객체를 인식하고 상호작용하는 Embodied AI 시스템에 활용 가능하다.
또한, 비디오 분석, 자동 콘텐츠 태깅, 스마트 홈 시스템 등에서 암묵적 지시에 기반한 객체 추적 기능을 구현할 수 있다.