한 줄 요약
Video2Skill은 스트리밍 영상에서 재사용 가능한 신체 기반 스킬을 발견하는 기준 평가 프레임워크로, 19개의 VLM 모델을 통해 스킬 그룹화 및 재사용 결정의 한계를 분석한다.
핵심 기여도
- **Streaming Embodied Skill Discovery (SESD)** 문제를 정의하고, **Video2Skill**이라는 새로운 평가 벤치마크를 제시.
- **19개 오픈소스 VLM 모델**을 평가하여, **그룹화 성능이 난수 수준에 가까운 경우가 많고, 모델 규모가 일관된 개선을 보장하지 않음**을 밝힘.
- **Counterfactual Library-state Rebalancing (CLaRe)**라는 새로운 **감독 학습 전략**을 제안.
- **Unified vs. Factorized 처리 방식**의 실패 패턴을 분석: 통합 모델은 스킬 병합, 분리 모델은 스킬 중복 생성 경향.
핵심 아이디어
기존 VLM은 개별 조작 행위를 설명하는 데 효과적이지만, **연속적인 영상 스트림을 재사용 가능한 스킬 라이브러리로 조직하는 능력은 부족**하다. 이 연구는 **Streaming Embodied Skill Discovery (SESD)** 문제를 제안하며, 모델이 **비디오를 순차적으로 처리하면서 지속적인 스킬 라이브러리를 유지**하고, 이를 바탕으로 **새로운 스킬을 생성하거나 기존 스킬을 재사용하는 결정을 내리는 능력**을 평가한다. 핵심 통찰은 **스킬 추출과 라이브러리 업데이트가 결합된 방식에 따라 성능이 크게 달라진다는 점**이다. 예를 들어, **통합 모델**(unified processing)은 서로 다른 변형을 하나의 스킬로 병합하는 경향이 있고, **분리 모델**(factorized processing)은 반복되는 변형에 대해 중복된 스킬을 생성한다.
기술적 접근법
- **Video2Skill**은 **RoboInter**와 **HD-EPIC** 데이터셋을 기반으로 구성되며, **로봇 테이블 조작**과 **인간 주방 활동**을 포함.
- 평가 지표는 세 가지: (i) **조작 이벤트의 시간적 위치**, (ii) **동일 변형의 이벤트 그룹화**, (iii) **기존 스킬 재사용 또는 새로운 스킬 생성 결정**.
- **CLaRe**(Counterfactual Library-state Rebalancing)는 **감독 학습 전략**으로, 라이브러리 상태를 반사적으로 재균형 잡아 **스킬 그룹화를 개선**.
- **Qwen3.5-4B**와 **LLaVA-OneVision-2-8B** 모델을 **Oracle-history SFT**, **CLaRe**, **on-policy correction** 세 가지 전략으로 **fine-tuning**.
주요 결과
- **19개 VLM 모델 중 많은 모델이 이벤트 그룹화 성능이 난수 수준**(near-chance level)에 가까움.
- **통합 처리**(unified) 모델은 **다른 변형을 하나의 스킬로 병합**, **분리 처리**(factorized) 모델은 **반복 변형에 대해 중복 스킬 생성**.
- **감독 학습**(SFT, CLaRe)은 **그룹화 성능을 개선**하지만, **새로운 변형을 라이브러리에 추가하는 능력은 여전히 제한적**.
- **CLaRe** 적용 후, **스킬 라이브러리 크기는 기준 대비 절반 이하로 유지**되고, **훈련 중에 보지 못한 변형은 시간상으로는 인식되지만 새로운 스킬로 추가되지 않음**.
의의 및 한계
- **Video2Skill**은 **재사용 가능한 스킬 라이브러리를 스트리밍 영상에서 학습하는 능력을 평가하는 첫 번째 벤치마크**로, **VLM의 추상화 능력 한계를 명확히 드러냄**.
- **감독 학습 전략**(CLaRe)은 **스킬 그룹화를 개선**하지만, **새로운 스킬 생성 판단 능력은 여전히 부족**.
- **한계점**은 **기존 스킬의 한계를 인식하지 못하는 모델의 경향**. 훈련되지 않은 변형은 **시간상으로는 인식되지만 새로운 스킬로 추가되지 않음**.
- **데이터셋 범위**는 **로봇 조작과 주방 활동에 제한**되어 있어, **외부 환경이나 더 넓은 도메인 적용 가능성은 검증되지 않음**.
실용적 활용
- **로봇 행동 학습**에서 **새로운 작업을 기존 스킬로 재구성**할 수 있는 능력을 향상시킬 수 있음.
- **인간 활동 분석**에서 **반복되는 행동 패턴을 추출**하여 **효율적인 행동 모델링**에 활용 가능.
- **VLM 기반 시스템**에서 **스킬 추출 및 재사용 결정**을 자동화하여 **사전 정의된 스킬 없이도 작업 수행 가능**.