한 줄 요약
LLaMA-Omni는 Llama-3.1-8B-Instruct 기반으로 구축된, 음성 입력을 직접 텍스트 및 음성 출력으로 생성하는 저지연 음성-LLM 상호작용 모델이다.
핵심 기여도
- LLaMA-Omni는 Whisper-large-v3 기반의 음성 인코더, 음성 어댑터, LLM, 스트리밍 음성 디코더로 구성된 **새로운 엔드투엔드 아키텍처**를 제안.
- **InstructS2S-200K**라는 200K 개의 음성 지시 및 응답 데이터셋을 생성하여 음성 상호작용 시나리오에 맞춤화.
- 응답 지연 시간이 최대 **236ms**에 달하며, 4개 GPU에서 **3일 미만**의 훈련 시간으로 모델 학습 가능.
- 기존 SpeechGPT 대비 **더 높은 음성 생성 품질**과 **낮은 지연**을 달성.
핵심 아이디어
LLaMA-Omni는 기존의 음성-텍스트-음성 순차 처리 방식을 대체하여, 음성 입력을 직접 텍스트 및 음성 출력으로 생성하는 엔드투엔드 아키텍처를 제안한다. 이는 음성 인코더와 스트리밍 음성 디코더를 LLM에 통합함으로써, 중간 텍스트 전사 없이 음성-음성 생성이 가능하도록 설계되었다. 특히, 스트리밍 음성 디코더는 **NAR (Non-Autoregressive) Transformer** 기반으로, LLM의 히든 상태를 입력으로 받아 **CTC (Connectionist Temporal Classification)**를 통해 음성 유닛을 예측하며, 텍스트 응답 생성과 동시에 음성 응답을 생성한다. 이는 응답 지연 시간을 최소화하면서도 음성 품질을 유지하는 핵심 아이디어이다.
기술적 접근법
- **모델 구성**: Whisper-large-v3 기반의 음성 인코더, 5× 다운샘플링 음성 어댑터, Llama-3.1-8B-Instruct, 스트리밍 음성 디코더 (2개의 Transformer 레이어, 4096 차원 히든, 32개 어텐션 헤드, 11008 차원 FFN, 425M 파라미터).
- **디코더 구조**: **NAR Transformer + CTC**, 음성 유닛을 스트리밍 방식으로 생성.
- **데이터셋**: InstructS2S-200K (200K 음성 지시 및 응답), 기존 텍스트 지시 데이터를 음성 합성하여 생성.
- **훈련**: 4개 GPU에서 3일 미만, 최소 1K 시간의 음성 데이터로 훈련.
주요 결과
- **S2TIF (Speech-to-Text Instruction Following)**: LLaMA-Omni는 ChatGPT Score에서 기존 베이스라인 대비 **가장 높은 성능**을 보임.
- **S2SIF (Speech-to-Speech Instruction Following)**: 응답 지연 시간이 최소 **236ms**, GPT-4o (320ms)보다 낮음.
- **ASR-WER**: LLaMA-Omni는 1K 시간의 훈련 데이터로도 **SpeechGPT 대비 훨씬 낮은 오류율**을 기록.
- **UTMOS**: 음성 품질 지표에서 다른 베이스라인 대비 **약간 높은 점수**를 기록.
의의 및 한계
LLaMA-Omni는 음성-LLM 상호작용 분야에서 **저지연, 고품질 응답 생성**을 가능하게 하며, 특히 **오픈소스 LLM 기반 음성 모델 개발의 효율성**을 높이는 데 기여한다. 또한, 스트리밍 음성 디코더를 통한 **동시 텍스트-음성 생성**은 응답 자연도와 유연성을 향상시킨다. 그러나, 음성 디코더 훈련에 사용된 데이터는 **산업용 TTS 모델 대비 1K 시간으로 매우 적어**, 음성 품질 개선에는 한계가 있다. 또한, 음성 유닛의 단위 크기(Ω)가 작을수록 **음성 불연속성 증가**로 품질 저하가 발생한다.
실용적 활용
LLaMA-Omni는 **스마트 스피커, 음성 비서, 자동차 내 음성 인터페이스** 등 실시간 음성 상호작용이 필요한 산업에 적용 가능하다. 특히, **저비용, 빠른 훈련 시간**으로 인해 연구실 환경에서도 빠르게 음성-LLM 모델을 개발할 수 있다. 제공된 GitHub 및 HuggingFace 링크를 통해 **코드 및 모델을 직접 활용**할 수 있다.