한 줄 요약
SwanTale은 자연어와 제로샷 기반의 다발성 음성 및 오디오 생성을 지원하는 통합 모델로, SwanData-Caption 데이터셋과 SwanVAE, Unified MoE 등 다양한 기술을 결합하여 뛰어난 표현력을 달성했다.
핵심 기여도
- SwanData-Caption: 다양한 음성 및 오디오 데이터를 정제하고, 다중 레벨의 정확한 캡션을 부여한 데이터셋을 제안.
- SwanTale: 제로샷과 인스트럭션 생성을 모두 지원하는 다발성 음성 및 오디오 생성 모델.
- SwanVAE: 다중 오디오 모달리티 생성을 지원하는 VAE 구조로, DiT prior의 학습 부담을 줄임.
- Unified MoE: 다중 작업 및 오디오 모달리티 모델링을 위한 효율적인 조합 방식.
핵심 아이디어
기존 TTS 시스템은 제로샷 기반의 음성 합성에 집중했으나, 창작 분야에서는 자연어 기반의 음성 및 환경 생성이 필요하다. SwanTale은 자연어 캡션과 제로샷 오디오 레퍼런스를 모두 처리할 수 있는 통합 모델로, SwanVAE와 Unified MoE를 통해 다중 오디오 모달리티를 처리한다. 특히, Engram conditioning과 reward-conditioned quality control을 결합하여 생성 품질을 향상시키며, curriculum learning과 GRPO post-training을 통해 점진적으로 모델 능력을 강화한다. 이는 기존 시스템이 단일 작업에만 최적화된 반면, SwanTale은 두 작업을 동시에 처리할 수 있다는 점에서 혁신적이다.
기술적 접근법
- **SwanData-Caption**: 다양한 음성 중심 미디어 오디오를 다중 레벨, 다중 스타일의 캡션으로 변환.
- **SwanVAE**: 다중 오디오 모달리티 생성을 위한 VAE 구조로, DiT prior의 학습 부담을 줄이며 재구성 품질을 향상.
- **Reward-conditioned quality control**: 강화 학습 없이 최고 품질의 추론 조건을 적용.
- **Engram conditioning**: 오디오 효과와 환경 정보를 포함한 조건부 생성.
- **Unified MoE**: 다중 작업 및 오디오 모달리티 모델링을 위한 효율적인 조합 방식.
- **Curriculum learning**: 제로샷 능력 → 캡션 조건 생성 → 전체 혼합 학습 순으로 점진적 학습.
- **GRPO post-training**: 발음 정확도, 생성 안정성, 캡션 조건 스피커 속성 제어 향상.
주요 결과
- **SwanBench-Speech**: 제로샷 단독 및 대화 TTS 평가에서 우수한 성능.
- **InstructTTSEval**: 자연어 기반 음성 생성에서 12개의 음성 속성 제어 정확도 상승.
- **SwanBench-Scene**: 180개의 인스트럭션 기반 생성 평가에서 평균 MOS 4.2 달성.
- **SwanBench-Caption**: 64개의 복잡한 캡션 기반 생성 평가에서 Instruction Accuracy 93.5%, Acoustic Quality 4.6, Overall Expressiveness 4.8.
- **Expressiveness**: 제로샷 및 인스트럭션 작업 모두에서 최고 점수 달성.
의의 및 한계
SwanTale은 자연어와 제로샷 기반의 통합 음성 및 오디오 생성을 가능하게 하며, 애니메이션 더빙, 오디오 드라마, 게임 등 다양한 창작 분야에서 활용 가능하다. 특히, 환경 효과와 스피커 성격을 포함한 복합 오디오 생성을 지원하는 점에서 기존 시스템과 차별화된다. 그러나, SwanData-Caption 데이터셋의 수집 비용이 높고, 일부 특수한 스타일은 여전히 부족할 수 있다. 또한, 모델의 복잡성으로 인해 실시간 응용에는 한계가 있을 수 있다.
실용적 활용
SwanTale은 애니메이션 더빙, 오디오 드라마, 게임, 광고, 쇼트비디오 제작 등에서 창작자들이 자연어로 음성 및 환경을 설계하고, 이후 제로샷 기반으로 재사용할 수 있도록 지원한다. 특히, 복잡한 대사와 오디오 효과를 동시에 생성할 수 있어, 오디오 편집 작업을 대폭 줄이고 창의적 표현을 강화할 수 있다.