한 줄 요약
GigaAM Multilingual은 2M시간의 오디오로 사전 학습된 Conformer 인코더를 통해 중앙아시아 언어 ASR 성능을 크게 향상시킨다.
핵심 기여도
- GigaAM Multilingual: 2M시간의 오디오로 사전 학습된 Conformer 인코더.
- 클러스터 수준의 데이터 균형 전략(cluster-level data balancing)을 사전 학습 단계에 도입.
- 도메인 인식 샘플링(domain-aware sampling)을 미세 조정(fine-tuning) 단계에 적용.
- Kyrgyz, Kazakh, Uzbek에서 Whisper Large v3, Omnilingual-1B 대비 더 높은 성능.
핵심 아이디어
기존의 다언어 ASR 모델은 헤드 언어(head language)에 치우쳐 데이터 불균형 문제를 해결하지 못한다. 본 연구는 이 문제를 해결하기 위해 사전 학습 단계에서 클러스터 수준의 데이터 균형 전략을 도입하여, 저자원 언어 그룹의 기여도를 증가시켰다. 또한, 미세 조정 단계에서는 도메인 인식 샘플링을 통해 헤드 언어의 지배를 완화시켰다. 이는 HuBERT-style 사전 학습과 Conformer 인코더 기반의 구조와 결합되어, Kyrgyz, Kazakh, Uzbek 등 중앙아시아 언어의 ASR 성능을 향상시키는 데 기여했다.
기술적 접근법
- **모델 구조**: Conformer 인코더를 사용.
- **사전 학습 데이터**: 2M시간의 오디오 데이터.
- **사전 학습 목적 함수**: HuBERT-style.
- **데이터 균형 전략**: cluster-level sampling weights를 사용한 group-aware reweighting.
- **미세 조정**: Russian, English, Kyrgyz, Kazakh, Uzbek 데이터를 사용한 domain-aware sampling.
- **데이터 종류**: open-source, synthetic speech, weakly-supervised, internally annotated 데이터 혼합.
주요 결과
- Kyrgyz, Kazakh, Uzbek에서 Whisper Large v3, Omnilingual-1B 대비 더 높은 성능.
- Common Voice, FLEURS, internal in-the-wild 데이터셋에서 평가.
- Kyrgyz/Kazakh/Uzbek에서 Whisper 대비 +10% 이상의 WER 개선.
- 240M 파라미터 모델이 Whisper Large v3(15억 파라미터)보다 더 빠르게 수렴.
의의 및 한계
GigaAM Multilingual은 데이터 불균형 환경에서 효과적인 다언어 ASR 모델 개발의 새로운 접근법을 제시한다. 특히, 저자원 언어 그룹의 성능을 향상시키는 데 기여하며, 실제 적용 가능성 있는 레시피를 제공한다. 그러나, 모든 언어 그룹에 대한 데이터 균형 전략의 일반화 가능성은 추가 연구가 필요하다. 또한, 사전 학습 데이터의 품질과 다양성에 따라 모델 성능이 크게 영향을 받을 수 있다.
실용적 활용
GigaAM Multilingual은 저자원 언어를 사용하는 지역의 ASR 시스템 개발에 활용될 수 있으며, 특히 Kyrgyz, Kazakh, Uzbek 등 중앙아시아 언어의 음성 인식을 위한 기초 모델로 사용 가능하다. 또한, 데이터가 제한된 상황에서 빠른 모델 적응과 데이터 큐레이션에도 유용하게 사용될 수 있다.