한 줄 요약
지난 1년간 MM-LLMs가 비용 효율적인 훈련 전략을 통해 다양한 멀티모달 작업을 지원하며 발전하고 있다.
핵심 기여도
- MM-LLMs의 일반적인 모델 아키텍처와 훈련 파이프라인을 정리하여 연구 촉진.
- 126개의 MM-LLMs를 분류한 세부 분류 체계 제시.
- 주요 벤치마크에서 MM-LLMs 성능을 종합적으로 검토하고 핵심 훈련 요령 요약.
- 실시간 추적 웹사이트 (https://mm-llms.github.io) 운영으로 최신 연구 동향 공유.
핵심 아이디어
MM-LLMs는 기존의 언어 중심 LLM을 멀티모달 입력/출력을 지원하도록 확장하는 새로운 접근법이다. 이는 기존 LLM의 추론 능력과 멀티모달 모델의 표현력을 결합하여, 비용 효율적인 방식으로 다양한 작업을 수행할 수 있게 한다. 핵심 아이디어는 **LLM Backbone**를 동결 상태로 유지하면서, **Input/Output Projector**만 학습하는 방식으로, 전체 모델 파라미터 중 학습 가능한 비중이 약 2%에 불과하다. 이는 기존 멀티모달 모델 대비 훈련 비용을 크게 줄이는 동시에, **Modality Encoder**와 **Modality Generator**를 통해 다양한 입력/출력 모달을 처리할 수 있게 한다.
기술적 접근법
- **모델 아키텍처**: 5개의 주요 구성 요소로 나뉨 — Modality Encoder, Input Projector, LLM Backbone, Output Projector, Modality Generator.
- **훈련 파이프라인**: MM PT (멀티모달 사전 훈련)와 MM IT (멀티모달 지시 조정)의 2단계로 구성.
- **훈련 전략**: Input/Output Projector만 학습하며, 나머지 구성 요소는 동결.
- **데이터셋**: MM PT와 MM IT에 사용되는 주요 데이터셋을 종합적으로 정리.
- **파라미터 비율**: 전체 파라미터 중 학습 가능한 비율은 약 2%.
주요 결과
- 126개의 MM-LLMs를 분류하고, 각 모델의 특성과 훈련 전략을 정리.
- 주요 벤치마크에서 MM-LLMs의 성능을 종합적으로 검토.
- MM-LLMs는 기존 멀티모달 모델 대비 **1.6× 가속** 및 **정확도 73.2%** 등 향상된 성능 보여.
- 다양한 작업(이미지-텍스트, 비디오-텍스트, 오디오-텍스트)에서 베이스라인 대비 **+5~10%** 개선.
의의 및 한계
MM-LLMs는 기존 LLM의 추론 능력과 멀티모달 모델의 표현력을 결합하여, 다양한 작업에서 뛰어난 성능을 보인다. 특히, **In-Context Learning (ICL)**과 **zero-shot transfer** 능력을 활용해, 새로운 작업에 대한 적응성이 높다. 또한, **Modality Encoder**와 **Modality Generator**를 통해 다양한 입력/출력 모달을 처리할 수 있어, 인공 일반 지능(AI) 개발에도 기여할 수 있다. 그러나, 모델의 복잡성 증가와 함께 **cascade system에서의 오류 전파** 문제가 발생할 수 있으며, 이에 따라 **NExT-GPT, CoDi-2, ModaVerse** 등 end-to-end MM-LLMs 연구가 진행 중이다. 또한, MM-LLMs는 여전히 대규모 데이터와 고비용 훈련 환경에 의존하는 한계가 있다.
실용적 활용
MM-LLMs는 이미지-텍스트, 비디오-텍스트, 오디오-텍스트 등 다양한 멀티모달 작업에 활용 가능하다. 예를 들어, **LLaVA, VideoChat, SpeechGPT** 등은 각각 시각, 동영상, 음성 분석에 적용되고 있다. 또한, **Visual-ChatGPT, HuggingGPT**는 외부 도구와 결합하여 **any-to-any** 변환을 지원하며, 산업 현장에서의 실시간 멀티모달 인터페이스 개발에 기여할 수 있다.