한 줄 요약
GigaChat Audio는 최대 120분의 오디오 입력을 처리하며, 시간 기반 질문에 정확한 타임스탬프를 포함한 답변을 생성하는 시간 인식 대형 오디오 언어 모델이다.
핵심 기여도
- 최대 120분의 오디오를 처리하는 시간 인식 대형 언어 모델(GigaChat Audio) 제안.
- 10,000+ 시간의 시간 기반 QA 및 타임드 텍스트 요약용 데이터셋 공개.
- 주기적 시간 마커(inter-timings)를 사용한 시간 정합성 향상, 60초 간격으로 삽입.
- 다양한 오디오 길이(초~시간)를 포함한 학습 데이터로 길이 일반화 성능 향상.
핵심 아이디어
기존 오디오 조건 대형 언어 모델(LLM)은 긴 오디오에서 시간 정합성(temporal grounding)이 불안정한 문제가 있었다. 이에 GigaChat Audio는 오디오 토큰 스트림에 주기적으로 시간 마커(inter-timings)를 삽입하여 시간 정보를 명시적으로 표현하는 방식을 도입했다. 이는 시간 기반 질문에 정확한 타임스탬프를 생성할 수 있도록 하며, 특히 60초 간격으로 삽입하는 것이 실험적으로 효과적임을 보여준다. 또한, 학습 데이터는 초~시간 길이의 오디오를 포함한 다중 길이 혼합(mixture of durations)으로 구성되어 있어, 모델이 다양한 길이의 오디오에 일반화할 수 있도록 한다. 이는 단일 길이 학습에서 성능 저하가 발생하는 문제를 해결한다.
기술적 접근법
- **모델 구조**: 10B-A1.8B MoE 텍스트 체크포인트에 오디오 프론트엔드를 결합한 모델.
- **오디오 인코딩**: encoder → subsampler → projector 구조, 8초 채크(40ms 스트라이드)로 160ms 프레임 레이트로 텍스트 임베딩 공간과 정렬.
- **학습**: HuBERT 유사 설정, 22M 시간의 다국어 무표지 오디오로 사전 학습.
- **시간 표현**: 60초 간격으로 inter-timings 삽입, plain-text 타임스탬프(hh:mm:ss) 또는 전용 timing token 사용.
- **하이퍼파라미터**: lr_dec=5×10⁻⁶, lr_enc=10⁻⁴.
주요 결과
- **mIoU**: 예측 구간과 참조 구간 간 중첩 비율을 기준으로 정확도 측정.
- **MAE**: 중간값 절대 오차(초 단위)로 시간 정확도 평가.
- **타임드 요약 평가**: Tm(시간 구조), Acc(사실 정확도), Err(오류), Style(스타일) 4차원 평가.
- **데이터셋**: 10,000+ 시간의 초~시간 길이 오디오를 포함한 시간 기반 QA 및 요약 데이터셋 공개.
- **성능 개선**: 단일 길이 학습 대비 다중 길이 학습에서 +12% 이상의 mIoU 향상.
의의 및 한계
GigaChat Audio는 오디오-조건 LLM에서 시간 정합성 문제를 해결하는 첫 번째 시도로, 120분 길이의 오디오 처리 및 시간 기반 답변 생성 기능을 제공한다. 특히, 주기적 시간 마커와 다중 길이 학습 데이터의 중요성을 실증적으로 입증하여, 시간 인식 오디오 모델 연구에 기초를 제공한다. 그러나, 모델은 학습 데이터의 질과 양에 크게 의존하며, 실제 응용 시 시간 마커의 빈도 조절이 성능-계산 비용 간 트레이드오프를 요구한다. 또한, 시간 기반 요약 평가에서 자동 평가 지표와 인간 평가 간의 불일치가 일부 존재한다.
실용적 활용
GigaChat Audio는 회의, 팟캐스트, 강의, 고객센터 로그 등 긴 오디오 콘텐츠를 처리하는 인터랙티브 시스템에 적용 가능하다. 사용자는 질문을 통해 특정 시간대의 오디오를 탐색하거나, 시간 기반 요약을 생성할 수 있어, 정보 검색 및 분석 효율성을 높일 수 있다. 특히, 고객 지원, 교육, 미디어 산업에서 실용적 활용이 기대된다.