GigaAM Multilingual: Foundation Model for Underrepresented Languages

Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin

arXiv:2607.10371 · 2026-07-21 공개 · arXiv · PDF

foundation-models pre-training speech-recognition multilingual-asr conformer data-balancing underrepresented-languages hubert

Abstract

Despite recent scaling successes, multilingual ASR performance remains highly uneven, with long-tail languages suffering from severe data scarcity. This work addresses the challenge of building robust foundation models for underrepresented Central Asian languages (Kazakh, Kyrgyz, Uzbek). We present GigaAM Multilingual, a Conformer encoder pre-trained on 2M hours of audio using a HuBERT-style objective. Crucially, we introduce a cluster-level data balancing strategy during pre-training and a domain-aware sampling method during fine-tuning to mitigate head-language dominance. In controlled comparisons, our approach outperforms strong open pretrained encoders (Whisper Large v3, Omnilingual-1B) on target languages, achieving significant gains on spontaneous speech while maintaining efficiency. We release the foundation encoder and ASR model, offering a proven recipe for effective multilingual adaptation under realistic data imbalance.

한국어 요약

한 줄 요약

GigaAM Multilingual은 2M시간의 오디오로 사전 학습된 Conformer 인코더를 통해 중앙아시아 언어 ASR 성능을 크게 향상시킨다.

핵심 기여도

핵심 아이디어

기존의 다언어 ASR 모델은 헤드 언어(head language)에 치우쳐 데이터 불균형 문제를 해결하지 못한다. 본 연구는 이 문제를 해결하기 위해 사전 학습 단계에서 클러스터 수준의 데이터 균형 전략을 도입하여, 저자원 언어 그룹의 기여도를 증가시켰다. 또한, 미세 조정 단계에서는 도메인 인식 샘플링을 통해 헤드 언어의 지배를 완화시켰다. 이는 HuBERT-style 사전 학습과 Conformer 인코더 기반의 구조와 결합되어, Kyrgyz, Kazakh, Uzbek 등 중앙아시아 언어의 ASR 성능을 향상시키는 데 기여했다.

기술적 접근법

주요 결과

의의 및 한계

GigaAM Multilingual은 데이터 불균형 환경에서 효과적인 다언어 ASR 모델 개발의 새로운 접근법을 제시한다. 특히, 저자원 언어 그룹의 성능을 향상시키는 데 기여하며, 실제 적용 가능성 있는 레시피를 제공한다. 그러나, 모든 언어 그룹에 대한 데이터 균형 전략의 일반화 가능성은 추가 연구가 필요하다. 또한, 사전 학습 데이터의 품질과 다양성에 따라 모델 성능이 크게 영향을 받을 수 있다.

실용적 활용

GigaAM Multilingual은 저자원 언어를 사용하는 지역의 ASR 시스템 개발에 활용될 수 있으며, 특히 Kyrgyz, Kazakh, Uzbek 등 중앙아시아 언어의 음성 인식을 위한 기초 모델로 사용 가능하다. 또한, 데이터가 제한된 상황에서 빠른 모델 적응과 데이터 큐레이션에도 유용하게 사용될 수 있다.