Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities

Zhifeng Kong, Arushi Goel, Rohan Badlani, Wei Ping, Rafael Valle, Bryan Catanzaro

arXiv:2402.01831 · 2026-07-27 공개 · arXiv · PDF

retrieval-augmented in-context-learning few-shot-learning multi-turn-dialogue training-strategies audio-understanding audio-language-model llm-audio

Abstract

Augmenting large language models (LLMs) to understand audio -- including non-speech sounds and non-verbal speech -- is critically important for diverse real-world applications of LLMs. In this paper, we propose Audio Flamingo, a novel audio language model with 1) strong audio understanding abilities, 2) the ability to quickly adapt to unseen tasks via in-context learning and retrieval, and 3) strong multi-turn dialogue abilities. We introduce a series of training techniques, architecture design, and data strategies to enhance our model with these abilities. Extensive evaluations across various audio understanding tasks confirm the efficacy of our method, setting new state-of-the-art benchmarks. Our demo website is https://audioflamingo.github.io/ and the code is open-sourced at https://github.com/NVIDIA/audio-flamingo.

한국어 요약

한 줄 요약

Audio Flamingo는 오디오 이해, 인-컨텍스트 학습, 다중 턴 대화 능력을 갖춘 새로운 오디오 언어 모델로, 다양한 벤치마크에서 최신 기록을 달성한다.

핵심 기여도

핵심 아이디어

Audio Flamingo는 기존 대형 언어 모델(LLM)이 오디오를 이해하는 능력을 확장하기 위해 설계되었다. 기존 모델은 오디오 정보를 텍스트로 변환한 후 처리하기 때문에, 비언어적 소리나 비언어적 발화를 무시하는 문제가 있었다. 이를 해결하기 위해, Audio Flamingo는 **Sliding Window 기반 오디오 특징 추출기**를 도입하여 긴 오디오의 시간적 구조를 유지하면서도 효율적으로 처리할 수 있도록 했다. 또한, **gated xattn-dense layers**를 사용하여 오디오 정보를 언어 모델에 조건부로 결합함으로써, 기존의 오디오 토큰을 앞에 붙이는 방식보다 계산 복잡도를 줄이고, 더 긴 오디오를 처리할 수 있도록 했다.

또한, Audio Flamingo는 **ICL과 RAG를 결합한 학습 전략**을 통해 미见过 작업에 빠르게 적응할 수 있도록 설계되었다. 이는 **interleaved ICL 데이터셋**과 **cross attention mask**를 통해 구현되었으며, 기존의 zero-shot 접근법과 달리 few-shot 성능을 향상시켰다. 마지막으로, **GPT-4 기반의 다중 턴 대화 데이터셋**을 생성하여, 오디오에 대한 대화 능력을 구축하고, 기존 대화 모델 대비 우수한 성능을 보였다.

기술적 접근법

주요 결과

의의 및 한계

Audio Flamingo는 오디오 이해, 인-컨텍스트 학습, 대화 능력을 모두 갖춘 첫 번째 모델로, **LLM의 다중 모달 처리 능력을 확장**하는 데 중요한 기여를 했다. 특히, **ICL과 RAG를 결합한 학습 전략**은 미见过 작업에 빠르게 적응하는 데 효과적이며, **GPT-4 기반의 대화 데이터셋**은 대화 모델의 성능을 향상시키는 데 기여했다. 또한, **1.3B 파라미터로 기존 3배 이상의 모델 대비 동일한 성능**을 달성한 점은 파라미터 효율성 측면에서 의미가 크다.

하지만, Audio Flamingo는 **복잡한 스피치 관련 작업**(예: 음성 인식, 감정 분석)에는 적용되지 않았으며, **오디오-텍스트 이외의 다른 모달**(예: 영상)과의 통합도 아직 이루어지지 않았다. 또한, **더 큰 LLM을 사용한 확장 전략**은 아직 연구되지 않았으며, 이는 향후 연구 주제로 남아 있다.

실용적 활용

Audio Flamingo는 음성 인식, 비언어적 소리 분석, 대화형 오디오 어시스턴트 등 다양한 산업 분야에 적용 가능하다. 특히, ICL과 RAG를 활용한 미见过 작업 적응 능력은 고객 지원, 교육, 보안 등 실시간 대응이 필요한 시스템에 유용할 수 있다. 또한, 다중 턴 대화 기능