한 줄 요약
F5-TTS는 ConvNeXt와 Sway Sampling을 도입한 비자기회귀 TTS 모델로, 100K시간 다국어 데이터셋에서 0.15의 RTF를 달성하고 제로샷 생성 능력을 보인다.
핵심 기여도
- ConvNeXt를 도입하여 E2 TTS의 텍스트-음성 정렬 문제를 개선 (WER 4.17, SIM 0.54).
- 추론 시 Sway Sampling 전략을 제안하여 자연도와 스피커 유사도를 향상 (WER 개선 +5.46).
- 100K시간 다국어 데이터셋에서 훈련하여 제로샷 생성, 코드스위칭, 속도 제어 성능을 달성.
- 0.15의 추론 RTF를 달성하며, 기존 확산 기반 TTS 모델 대비 빠른 추론 속도.
핵심 아이디어
F5-TTS는 E2 TTS의 단순한 텍스트-음성 정렬 방식을 유지하면서도, ConvNeXt를 도입하여 텍스트 표현을 정제하고, 추론 시 Sway Sampling 전략을 통해 정렬 문제를 해결한다. E2 TTS는 텍스트를 필러 토큰으로 패딩하여 음성 길이와 맞추고, 디노이징을 통해 음성을 생성하지만, 이는 느린 수렴과 낮은 안정성을 초래한다. F5-TTS는 ConvNeXt를 사용해 텍스트 표현을 개선하고, Sway Sampling을 통해 흐름 단계에서의 샘플링 전략을 조정함으로써, 텍스트와 음성 간의 정렬을 안정적으로 수행한다. 특히, Sway Sampling은 훈련 없이 기존 흐름 매칭 기반 모델에도 적용 가능하다는 점에서 실용적이다.
기술적 접근법
- **모델 아키텍처**: Diffusion Transformer (DiT) 기반으로, ConvNeXt V2를 텍스트 표현 정제에 활용.
- **입력 처리**: 텍스트는 필러 토큰으로 패딩되어 음성 길이와 동일하게 처리.
- **추론 전략**: Sway Sampling을 도입하여 흐름 단계의 샘플링을 조정.
- **훈련 데이터**: 100K시간 규모의 다국어 데이터셋 사용.
- **하이퍼파라미터**: 155M 파라미터 규모의 소형 모델로 800K 업데이트 수행.
- **성능 지표**: WER 4.17, SIM 0.54 (E2 TTS 대비 WER +5.46 개선).
주요 결과
- **WER**: F5-TTS는 800K 업데이트 후 4.17 (E2 TTS: 9.63, +5.46 개선).
- **SIM**: 0.54 (E2 TTS: 0.53, +0.01 개선).
- **RTF**: 0.15 (기존 확산 기반 TTS 대비 훨씬 빠름).
- **제로샷 생성**: 훈련되지 않은 데이터에서도 자연스럽고 표현력 있는 음성 생성.
- **코드스위칭**: 다국어 환경에서 원활한 언어 전환 능력.
의의 및 한계
F5-TTS는 E2 TTS의 단순성과 확산 모델의 생성력을 결합한 새로운 비자기회귀 TTS 시스템으로, 제로샷 생성과 빠른 추론 속도를 동시에 달성한 점에서 학술적·실용적 가치가 있다. 특히, Sway Sampling은 추론 단계에서만 적용 가능하며, 기존 모델에 쉽게 통합할 수 있어 확산 기반 TTS 연구에 기여할 수 있다. 그러나 E2 TTS와 마찬가지로 텍스트-음성 정렬 문제는 여전히 존재하며, 일부 샘플에서는 정렬 실패가 발생한다. 또한, ConvNeXt 기반 텍스트 표현이 모든 언어에 동일하게 효과적이라는 점은 추가 연구가 필요하다.
실용적 활용
F5-TTS는 제로샷 생성과 빠른 추론 속도를 바탕으로, 대화형 음성 인터페이스, 멀티모달 응용, 다국어 음성 생성 등 다양한 산업 분야에서 활용 가능하다. 특히, 코드스위칭과 속도 제어 기능은 글로벌 서비스 개발에 유용하며, 오픈소스 공개를 통해 연구자 및 개발자들이 쉽게 활용할 수 있다.