한 줄 요약
AVA-Encoder는 영화 콘텐츠를 에이전트가 이해하고 편집할 수 있는 구조화된 지식 그래프로 변환하여, 에이전트 네이티브 비디오 표현 학습을 구현한다.
핵심 기여도
- **AVA-Encoder 프레임워크**를 제안하여, 영화를 지식 그래프(KG)로 인코딩하고 다시 비디오로 재구성함으로써 에이전트가 학습 가능하고 편집 가능한 표현을 생성.
- **20.7% 절대 개선**을 기록하며, 가장 강력한 외부 베이스라인 대비 성능 향상.
- **74.3% 적은 시스템 프롬프트 토큰**을 사용하면서도, 인간이 조정한 정책보다 성능 우수함.
- **첫 번째 고품질 영화 KG 표현 데이터셋**을 공개.
핵심 아이디어
AVA-Encoder는 영화를 단순히 텍스트나 픽셀로 변환하는 기존 접근과 달리, **구조화된 지식 그래프**로 표현함으로써 에이전트가 영화의 스토리, 캐릭터, 샷, 카메라 언어 등을 이해하고 편집할 수 있도록 한다. 이는 **Story–Event–Shot 계층 구조**와 **Character, Scene, Object, Style, Camera, Audio 상태 노드**를 사용하여 텍스트 중심의 표현을 구성하고, 생성된 이미지, 오디오, 비디오 자산은 별도의 **링크된 자산 계층**에 저장된다.
**Typed edges**는 텍스트 설명과 자산 간의 관계를 보존하여, 에이전트가 그래프를 통해 정보를 탐색하고 수정할 수 있도록 한다. 재구성 오류는 **텍스트-그라디언트 최적화 프레임워크**를 통해 자연어 피드백으로 변환되어, **Data-Independent Encoding Policy Pseudo-Training**과 **Data-Dependent KG Representation Refinement**의 두 단계에서 정책과 표현을 개선한다.
기술적 접근법
- **Agentic Video Encoder**는 영화, 샷, 키프레임 수준에서 분석을 수행하며, 상위 컨텍스트를 하위 수준으로 전달하여 정보 손실을 최소화.
- **Gemini-3.1-Pro-Preview**는 비디오 이해 모델과 평가 모델로 사용.
- **Qwen-3.7-Max**는 텍스트-그라디언트 기반 수정을 제안하는 수정 모델.
- **Nano Banana Pro**와 **HappyHorse 1.0**은 이미지 생성 및 레퍼런스-투-비디오 생성에 사용.
- **Data-Independent Encoding Policy Pseudo-Training**은 샷 수준 Agentic Video Encoder 정책만 업데이트.
- **Data-Dependent KG Representation Refinement**는 입력별 KG 표현만 업데이트하며, 선택적 수행.
주요 결과
- **Overall Reconstruction Score 49.0%**를 달성, 가장 강력한 외부 베이스라인(28.3%) 대비 **20.7% 절대 개선**.
- **Policy-only 설정**에서, **Pseudo-trained Agentic Video Encoder 정책**이 인간 조정 정책(44.4%) 대비 **45.8%** 성능을 달성하면서 **74.3% 적은 시스템 프롬프트 토큰** 사용.
- **18개 평가 비디오**에서 다양한 영화 콘텐츠(예: Spirited Away, Joker, Titanic 등)를 포함한 129 샷, 246 키프레임을 처리.
의의 및 한계
AVA-Encoder는 에이전트가 영화를 학습하고 생성할 수 있는 **구조화된 표현 기반 학습 프레임워크**를 제시하며, **에이전트 기반 편집 가능성**과 **영화 재구성 정확도**를 동시에 달성한 점에서 학술적·실용적 의의가 있다. 특히, **KG 표현**은 그래프 기반 편집을 가능하게 하여, 기존 텍스트나 픽셀 기반 표현보다 훨씬 유연한 편집이 가능하다는 장점이 있다.
그러나, **입력 영상의 구조화 분할 정책**은 시스템마다 다를 수 있어, **표준화된 평가 기준**이 필요하다는 한계가 있다. 또한, **재구성 과정에서 발생하는 정보 손실**은 여전히 개선이 필요한 부분이다.
실용적 활용
AVA-Encoder는 **영화 제작 에이전트**, **스크립트-비디오 생성 시스템**, **에이전트 기반 콘텐츠 편집 플랫폼** 등에 적용 가능하다. 특히, **구조화된 표현을 기반으로 한 편집 및 생성**이 필요한 창의적 AI 연구 분야에서 활용도가 높으며, **에이전트가 영화를 학습하고 생성하는 기반 인프라**로 활용될 수 있다.