한 줄 요약
Realtime-Venus는 비동기적 위임을 지원하는 프로액티브 풀-더플렉스 대화 시스템으로, 9B 규모의 두 모델을 통해 영상 및 음성 대화 성능을 개선한다.
핵심 기여도
- Realtime-Venus-Omni와 Realtime-Venus-Audio라는 두 개의 9B 규모 모델을 개발하여, 각각 영상-음성 통합 대화와 음성 대화를 지원.
- Realtime-Venus-Harness라는 비동기적 실행 프레임워크를 도입하여, 대화 중 외부 작업 수행과 결과 통합을 가능하게 함.
- StreamingBench(70.2%), Daily-Omni(81.3%) 등 6개의 영상 벤치마크에서 최고 성능 달성.
- Full-Duplex-Bench v1.5에서 사용자 중단 응답률 75%와 97%, 88%, 86%의 대화 이어가기 성능을 기록.
핵심 아이디어
Realtime-Venus는 사용자의 입력, 모델 출력, 위임 이벤트를 공유된 인과적 타임라인에 매핑하여, 대화의 일관성을 유지하면서도 비동기적 작업을 처리할 수 있도록 설계되었다. 이는 기존 시스템이 대화 중 외부 작업을 수행할 때 발생하는 컨텍스트 분산 문제를 해결한다. 두 모델은 각각 Omni-Flow 아키텍처를 기반으로 하며, Realtime-Venus-Omni는 시각 정보를 처리하는 SigLIP2와 음성 인코딩을 위한 Whisper-Medium을 결합한 다중 모달 인코더를 사용한다. 반면, Realtime-Venus-Audio는 오디오 전용으로 설계되어 ViT 기반의 시각 분기 없이 처리된다.
모델은 1초 단위의 스트리밍 단위로 구성되며, 각 단위에서 `<|listen|>` 또는 `<|speak|>` 토큰을 예측하여 대화 제어를 수행한다. 이는 사용자의 백채널(backchannel)와 중단(interruption)을 구분하여, 대화의 자연스러움을 유지하는 핵심 요소이다. 위임 요청은 요청 시점의 증거 스냅샷과 함께 처리되며, 결과는 대화 맥락에 맞게 재해석되어 사용자에게 전달된다.
기술적 접근법
- **모델 아키텍처**: Realtime-Venus-Omni는 SigLIP2와 Whisper-Medium을 결합한 다중 모달 인코더를 사용하며, Realtime-Venus-Audio는 오디오 전용 인코더를 사용.
- **스트리밍 단위**: 1초 단위로 처리되며, 각 단위에서 `<|listen|>` 또는 `<|speak|>` 토큰을 예측.
- **S3 음성 토큰**: Qwen3-8B 언어 백본이 생성한 텍스트와 히든 상태를 기반으로 S3 음성 토큰을 생성.
- **Realtime-Venus-Harness**: 위임 작업을 비동기적으로 실행하고, 결과를 대화 맥락에 맞게 재해석하여 통합.
- **데이터 파이프라인**: 시나리오 계획, 음성 실현, 시간 정렬을 결합한 트래젝토리 생성.
주요 결과
- **영상 벤치마크**: Realtime-Venus-Omni는 StreamingBench(70.2%), OVO-Bench(64.7%), Daily-Omni(81.3%) 등 6개의 영상 벤치마크에서 최고 성능.
- **음성 벤치마크**: Realtime-Venus-Audio는 MMAU(78.0%), MMAU-Pro(63.2%), Llama Questions(83.8%), Speech CMMLU(67.8%)에서 최고 성능.
- **VoiceBench AlpacaEval**: 4.81의 점수를 달성하며, 기존 최고 성능과 동일.
- **Full-Duplex-Bench v1.5**: 사용자 중단 응답률 75%, 백채널(97%), 타인 대화(88%), 배경 음성(86%)에서의 이어가기 성능을 기록하며, Gemini 3.1 Live와 GPT-4o를 상회.
의의 및 한계
Realtime-Venus는 풀-더플렉스 대화와 비동기적 위임을 결합한 첫 번째 시스템으로, 대화 중 외부 작업 수행 시 일관된 컨텍스트 유지가 가능하다는 점에서 학술적·실용적 가치가 있다. 특히, Realtime-Venus-Omni는 영상 인식과 음성 생성을 동시에 처리하면서도, 외부 작업을 비동기적으로 실행하는 기술적 혁신을 보여준다.
그러나, 일부 벤치마크에서는 다른 모델과 유사한 성능을 보이는 경우가 있으며, 복잡한 위임 작업의 정확도 개선이 필요하다는 한계가 있다. 또한, 장기적인 영상 이해를 위한 메모리 모듈은 훈련 없이 통합되었으나, 훈련 데이터의 질에 따라 성능이 변동할 수 있다.
실용적 활용
Realtime-Venus는 스마트 스피커, 가상 비서, 영상 기반 고객 지원 시스템 등에서 활용 가능하다. 특히, 사용자의 실시간 음성 및 영상 입력을 처리하면서 외부 API 호출을 비동기적으로 수행해야 하는 상황에서 유용하다. 예를 들어, 영상 기반 고객 상담 시, 사용자의 질문을 인식하고 동시에 외부 데이터베이스에서 정보를 검색하여 즉시 응답할 수 있다.