한 줄 요약
X-AuT는 Qwen3-ASR 모델의 오디오 인코더를 점진적으로 압축하면서 정확도를 유지하는 프레임워크로, 14층 모델에서 20.7%의 파라미터 감소와 5.75%의 매크로 오류를 달성한다.
핵심 기여도
- 점진적 압축 프레임워크(X-AuT)를 제안하여, 레이어 조합을 행동 탐지(behavioral probe)로 선정하고, 표현 정렬, 크로스-스케일 디스틸레이션, LoRA 미세조정을 통해 복구한다.
- 1.7B 스케일의 선생 모델을 사용한 디스틸레이션으로 평균 오류율을 8.45%에서 5.55%로 개선한다.
- 14층 모델은 20.7%의 오디오 타워 파라미터 감소를 달성하면서 5.75%의 매크로 오류를 보인다.
- 레이어 쌍 탐지에서 {5,6} 조합이 {6,8} 조합보다 0.85pp 우수한 성능을 보인다.
핵심 아이디어
X-AuT는 기존 오디오 인코더의 레이어를 단계적으로 제거하면서 정확도 손실을 최소화하는 프레임워크이다. 기존 연구에서는 레이어 제거가 디코더 입력에 영향을 주어 조기 종료(EOS) 또는 삭제 오류를 유발할 수 있다는 문제를 지적하고, 이를 해결하기 위해 **레이어 조합 선정**, **표현 정렬**, **크로스-스케일 디스틸레이션**, **LoRA 미세조정**을 결합한다.
핵심 아이디어는 **점진적(prgressive)**이라는 점이다. 즉, 레이어 제거 후 복구 과정을 단계적으로 수행하며, 각 단계에서 **짧은 행동 탐지(probe)**를 통해 최적의 레이어 조합을 선정한다. 이는 단일 레이어의 중요도가 다른 레이어 제거와 상호작용하면서 달라질 수 있기 때문이다. 예를 들어, {6,8} 조합은 개별적으로 제거했을 때 가장 강력한 후보이지만, {5,6} 조합이 0.85pp 더 우수한 성능을 보인다. 이는 레이어 간 비가산적 상호작용을 반영한 결과이다.
기술적 접근법
- **레이어 조합 선정**: 짧은 행동 탐지를 통해 레이어 조합을 평가.
- **표현 정렬**: 제거된 레이어를 보완하기 위해 중간 표현과 브릿지 표현을 정렬.
- **크로스-스케일 디스틸레이션**: 1.7B 스케일의 선생 모델을 사용하여 학생 모델을 교육.
- **LoRA 미세조정**: 디코더의 어텐션 LoRA 어댑터와 출력 임베딩만 조정하며, 언어 모델 본체는 동결.
- **트랜스크립트 일관성 파이프라인**: 학습 데이터를 일관성 높은 상위 티어로 필터링.
- **소스 재가중**: 미세조정 단계에서 데이터 소스의 가중치를 조정.
주요 결과
- Qwen3-ASR-0.6B 모델에서 오디오 인코더를 18층에서 16층으로 압축했을 때, 매크로 평균 오류율이 5.61%에서 5.27%로 감소.
- 14층 모델은 5.75%의 매크로 오류를 기록하며, 오디오 타워 파라미터가 20.7% 감소(186.4M → 147.8M).
- 1.7B 스케일의 선생 모델을 사용한 디스틸레이션은 5.55%의 평균 오류를 달성, 자가 디스틸레이션(8.45%) 대비 3.9% 개선.
- 점진적 18→14층 압축은 직접 압축(6.73%) 대비 0.98pp 우수한 성능(5.75%).
의의 및 한계
X-AuT는 기존 오디오 인코더 압축 방법과 달리, 레이어 제거 후 복구 과정을 점진적으로 수행함으로써 정확도 손실을 최소화하는 새로운 접근법을 제시한다. 특히, **크로스-스케일 디스틸레이션**을 통해 선생 모델의 강력한 표현력을 학생 모델에 전달함으로써, 기존의 자가 디스틸레이션보다 훨씬 높은 정확도를 달성한다. 또한, **LoRA 기반의 미세조정**은 파라미터 수를 줄이면서도 디코더 인터페이스를 유지하는 데 기여한다.
그러나, 이 연구는 단일 모델 패밀리(Qwen3-ASR)에서 단일 실행 결과만을 기반으로 하기 때문에, **다양한 모델 아키텍처나 반복 실험을 통해 일반화 가능성**을 검증하는 것이 필요하다. 또한, 레이어 조합의 선택이 특정 데이터셋에 따라 달라질 수 있으므로, **다양한 언어나 도메인에서의 성능 차이**도 추가 연구 주제이다.
실용적 활용
X-AuT는 스트리밍, 모바일, 차량 내 시스템과 같은 실시간 음성 인식 환경에서 유용하게 활용될 수 있다. 특히, **인코더 레이어 수를 줄이면서도 정확도를 유지**하는 점에서,