한 줄 요약
MaskGCT는 정렬 정보와 단위별 지속 시간 예측 없이, 마스킹-예측 학습을 기반으로 100K 시간의 데이터에서 최고 수준의 제로샷 TTS 성능을 달성한 2단계 비자귀적 모델이다.
핵심 기여도
- MaskGCT는 **정렬 정보**와 **폰 단위 지속 시간 예측** 없이 작동하는 **완전한 비자귀적 TTS 모델**이다.
- **2단계 구조** (T2S, S2A)를 통해 텍스트에서 의미 토큰을 생성하고, 이를 기반으로 음성 토큰을 생성한다.
- **100K 시간의 in-the-wild 음성 데이터**를 사용한 실험에서 기존 제로샷 TTS 시스템보다 **품질, 유사도, 인지도**에서 우수한 성능을 보인다.
- **VQ-VAE 기반의 SSL 임베딩 양자화**를 통해 의미 토큰을 추출하며, 단일 코드북에서도 정보 손실을 최소화한다.
핵심 아이디어
MaskGCT는 기존 TTS 시스템에서 자주 사용되는 **자귀적**(autoregressive) 또는 **비자귀적**(non-autoregressive) 접근 방식의 한계를 극복하기 위해 **마스킹-예측**(mask-and-predict) 학습 패러다임을 도입한 모델이다. 기존 비자귀적 모델은 텍스트-음성 정렬 정보와 단위별 지속 시간 예측이 필요했지만, MaskGCT는 이를 생략하고 **컨텍스트 학습**(in-context learning)을 통해 텍스트와 프롬프트를 기반으로 의미 토큰을 예측한다.
첫 번째 단계인 **T2S**(Text-to-Semantic) 모델은 텍스트와 프롬프트를 조건으로 하여 의미 토큰을 생성하며, 두 번째 단계인 **S2A**(Semantic-to-Acoustic) 모델은 이 토큰을 기반으로 음성 토큰을 생성한다. 이는 **RVQ 기반 음성 코덱**에서 추출된 토큰을 사용하며, **SoundStorm**와 유사한 구조를 채택하지만, 의미 토큰 생성 단계에서도 마스킹-예측 방식을 활용한다.
이러한 구조는 **정렬 정보 없이도 텍스트에서 음성까지의 매핑을 학습**할 수 있도록 하며, **다양한 음성 길이를 병렬적으로 생성**할 수 있는 장점을 가진다.
기술적 접근법
- **모델 구조**: 2단계 구조 (T2S, S2A)로 구성.
- **T2S 모델**: 텍스트 토큰과 프롬프트 토큰을 조건으로 하여 의미 토큰을 예측.
- **S2A 모델**: 의미 토큰을 기반으로 RVQ 기반 코덱에서 추출된 음성 토큰을 예측.
- **학습 방식**: **mask-and-predict** 학습 패러다임을 사용. 훈련 시 마스킹된 토큰을 예측하도록 학습.
- **토큰 추출**: **VQ-VAE**를 사용하여 SSL 임베딩을 양자화하여 의미 토큰을 추출.
- **데이터**: **100K 시간의 in-the-wild 음성 데이터** 사용.
- **추론**: **병렬 생성** 방식으로, 지정된 길이의 토큰을 몇 번의 반복 스텝으로 생성.
주요 결과
- **LibriSpeech, SeedTTS test-en, test-zh** 데이터셋에서 **CMOS**(Continuous Mean Opinion Score) 기준으로 기존 모델 대비 **품질 및 자연도**가 우수.
- **SIM-O**(Similarity) 지표에서 **+0.017, -0.002, +0.027** 개선.
- **SMOS**(Speech MOS) 지표에서 **+0.28, +0.32, +0.25** 개선.
- **WER**(Word Error Rate) 기준으로 **test-zh에서 10.19 → 2.507**, **test-en에서 8.096 → 2.346** 개선.
- **25개의 추론 스텝**에서 **WER 최소화**와 **SIM 최대화**를 달성.
- **모델 크기**는 기존 base 모델로도 100K 시간 데이터에서 우수한 성능을 보임.
의의 및 한계
MaskGCT는 **정렬 정보와 단위별 지속 시간 예측 없이도** 높은 품질의 제로샷 TTS를 가능하게 하며, **다양한 음성 생성**과 **길이 제어**가 가능하다는 점에서 기존 모델보다 유연하다. 또한, **음성 번역, 음성 변환, 감정 제어, 콘텐츠 편집** 등 다양한 음성 생성 관련 작업에 확장 가능하다는 점에서 **기초 모델**(foundation model)로서의 잠재력을 보인다.
하지만, **추론 스텝 수**(inference timesteps)에 따라 성능이 변동하며, **최적의 스텝 수**(25)를 찾는 과정이 필요하다는 한계가 있다. 또한, **모델 크기와 데이터 규모의 확장 법칙**(scaling law)에 대한 연구는 아직 진행 중이며, **더 큰 모델이나 데이터로의 확장 가능성**은 명시되지 않았다.
실용적 활용
MaskGCT는 **대규모 음성 생성**, **음성 번역**(cross-lingual dubbing), **음성 변환**(voice conversion), **감정 제어**, **콘텐츠 편집** 등 다양한 음성 생성 및 편집 작업에 적용 가능하다. 특히,