StepAudio 3 Realtime Technical Report
Bin Lin, Bo Zhao, Boyang Zhang, Boyong Wu, Chao Yan, Chen Geng, Chen Wu, Cheng Yi, Chengli Feng, Chenglin Zhu, Chengting Feng, Chengyuan Yao, Daijiao Liu, DanNi Wan, Daxin Jiang, Dongjian Li, Dongqing Pang, Fei Tian, Feng Tian, Future Li, Gang Yu, Guanglong Yang, Haoyang Zhang, Hongyuan Wang, Jia Peng, Jiahao Song, Jialong Xue, Jiamin Fan, Jiangjie Zhen, Jianzheng Gao, Jincheng Wen, Jinghua Liang, Jinglan Gong, Jun Chen, Li Xie, Liang Zhao, Lifang Zhang, Lingli Ji, Lun Cai, Min Xu, Peilin Li, Peng Yang, Pengfei Tan, Qingjian Lin, Qinxin Du, Ruijie Xiong, Runze Li, Shenghua Hu, Shengqian Qin, Shi Qiu, Siqi Tu, Siyi Zhou, Tianjiao Deng, Wanying Lu, Weiming Niu, Wen Sun, WenWen Qu, Xiangyu Zhang, Xianwei Zhang, Xiaosu Su, Xing Chen, Xinyu Liu, Xuerui Yang, Yan Wu, Yang Li, Yang Yang, Yechang Huang, Yibo Zhu, Yifan Zhang, Yinuo Yan, Youjun Chen, Yu Fu, Yu Luo, Yu Zhou, Yujie Chen, Yumang Wang, Yunzhou Ju, Yuxiang Yang, Yuxin Li, Yuxin Zhang, Zekai Liu, Zengwei Yao, Zhaoxin Yuan, Zhenwei Mou, Zhiquan Zhang, Zhiyue Wu, Zichao Li, Zichao Zhou, Ziqi Ren, Zixuan Wang
arXiv:2609.14005 · 2026-09-16 공개 · arXiv · PDF
full-duplex task-success audio-language think-while-speaking voice-agent mmsu dialogue-system reasoning-model
Abstract
Realtime spoken interaction demands deep reasoning, prompt responses, and fluid turn-taking. We present StepAudio 3 Realtime, an audio-language foundation model organized around a continuous listen-converse-think-act loop. Deep Perception captures rich acoustic cues to interpret user intent, while Seamless Duplex models synchronized audio streams to handle pauses, backchannels, and interruptions naturally. Crucially, we resolve the tension between deep deliberation and latency via Think-While-Speaking, executing private reasoning in parallel with spoken delivery. In reasoning mode, StepAudio 3 reaches a 73.0 macro average on StepAudioChat. With Think-While-Speaking, it achieves dialogue and reasoning performance comparable to dedicated reasoning models while speaking in real time. Furthermore, an integrated Voice Agent handles asynchronous tool execution without disrupting the dialogue flow. StepAudio 3 Realtime achieves top-tier performance across key dimensions: an exceptional 90.6 on the MMSU benchmark, 98.9 Overall on the Artificial Analysis Full-Duplex Bench, and a 56.0% macro task-success rate on τ-Voice.
한국어 요약
한 줄 요약
StepAudio 3 Realtime은 Think-While-Speaking을 통해 실시간 대화 중 사고와 응답을 병행하는 오디오-언어 기반 모델로, MMSU 90.6, τ-Voice 56.0% 등 주요 지표에서 뛰어난 성능을 보인다.
핵심 기여도
- **Think-While-Speaking**을 통해 사고와 응답을 병행하여 대화 흐름을 방해하지 않음.
- **Seamless Duplex** 모듈로 일시정지, 중간 응답, 중단을 자연스럽게 처리.
- **Deep Perception**을 통해 음성에서 사용자 의도를 정확히 파악 (StepAudioChat 73.0 macro average).
- **Voice Agent**를 통한 비동기 툴 실행으로 대화 흐름 유지 (τ-Voice 56.0% task-success rate).
핵심 아이디어
StepAudio 3 Realtime은 "listen-converse-think-act" 루프를 기반으로 한 실시간 음성 대화 모델로, 기존 모델들이 사고와 응답을 순차적으로 처리하는 방식과 달리, **Think-While-Speaking**을 도입하여 사고와 응답을 병행한다. 이는 사용자와의 자연스러운 토론을 가능하게 하며, 특히 **Deep Perception** 모듈을 통해 음성의 언어적, 비언어적 요소를 동시에 분석하여 사용자 의도를 더 정확히 파악한다. 또한, **Seamless Duplex**는 사용자와 모델의 음성을 동기화하여 일시정지, 중간 응답, 중단을 자연스럽게 처리하며, **Voice Agent**는 툴 실행을 비동기적으로 처리해 대화 흐름을 방해하지 않는다.
기술적 접근법
- **Deep Perception**: 사용자의 음성에서 언어적 및 비언어적 정보를 동시에 추출.
- **Seamless Duplex**: 사용자와 모델의 음성을 동기화하여 일시정지, 중간 응답, 중단 처리.
- **Think-While-Speaking**: 사고와 응답을 병행하여 대화 흐름 유지.
- **Voice Agent**: 비동기 툴 실행을 관리.
- **Adaptive Thinking**: 필요에 따라 사고의 깊이를 조절.
- **Multi-token prediction**: 응답 생성 시 여러 토큰을 동시에 예측하여 응답 속도 향상.
- **Full-duplex 처리**: 사용자 음성과 응답을 동시에 처리 (AA Full-Duplex Bench 98.9).
주요 결과
- **StepAudioChat**에서 73.0 macro average (사전 학습 모델 대비).
- **MMSU 벤치마크**에서 90.6 점 (8개 벤치마크 중 4위).
- **AA Full-Duplex Bench**에서 98.9 Overall 점수 (Qwen Audio 3.0 Realtime Plus 대비 +0.5).
- **τ-Voice**에서 56.0% macro task-success rate (Grok 56.5% 대비 -0.5, GPT 45.7% 대비 +10.3).
- **LibriSpeech test-clean**에서 1.18 WER (Doubao 2.0 ASR 대비 -1.76).
의의 및 한계
StepAudio 3 Realtime은 **Think-While-Speaking**을 통해 사고와 응답을 병행하는 기술을 실현하여, 기존 모델들이 대화 중 사고를 일시 중지해야 했던 한계를 극복했다. 또한, **Seamless Duplex**와 **Voice Agent**를 통해 대화 흐름을 자연스럽게 유지하며, **Deep Perception**을 통해 사용자 의도를 정확히 파악하는 것이 학술적·실용적 가치가 있다. 그러나 **다중 턴 제약 준수**와 **소매 도메인 툴 사용**에서는 여전히 개선이 필요하며, **Adaptive Thinking**이 모든 경우에 답변 품질을 향상시키는 것은 아님을 연구는 지적한다.
실용적 활용
StepAudio 3 Realtime은 **고객 서비스**, **텔레콤**, **소매** 등 실시간 음성 대화가 필요한 산업에서 활용 가능하다. 특히, **Voice Agent**를 통해 비동기 툴 실행을 지원하며, **Full-duplex 처리**를 통해 사용자와의 자연스러운 대화를 가능하게 하므로, **챗봇**, **음성 비서**, **고객 지원 시스템** 등에 적합하다.