한 줄 요약
SWIFT는 350개 이상의 LLM과 80개 이상의 MLLM을 지원하는 오픈소스 파인튜닝 인프라로, 다양한 후처리 기술을 통합하여 대형 모델 활용을 용이하게 한다.
핵심 기여도
- 350+ LLM과 80+ MLLM을 지원하는 최초의 통합 파인튜닝 프레임워크.
- MLLM에 대한 체계적인 지원을 제공하며, 추론, 평가, 양자화 등의 후처리 과정을 통합.
- EvalScope를 활용해 100개 이상의 텍스트 및 멀티모달 평가셋을 지원.
- 커스텀 평가 데이터셋(CEval 형식, ROUGE/BLEU 기반)을 지원하여 유연한 평가 가능.
핵심 아이디어
기존 대형 모델 학습 프레임워크는 특정 모델이나 기술에 제한적이며, 새로운 모델 지원이 부족해 개발자들이 파인튜닝을 어렵게 하는 문제를 해결하기 위해 SWIFT가 개발되었다. SWIFT는 Hugging Face의 Transformers, PEFT, TRL, Open-R1 등 다양한 오픈소스 기술을 기반으로, 파인튜닝, 추론, 평가, 양자화를 포함한 전체 워크플로우를 커버하는 인프라를 제공한다. 특히, 멀티모달 모델(Qwen2.5-VL, InternVL3 등)에 대한 체계적인 지원이 핵심 차별점이다. SWIFT는 LoRA, rsLoRA, DoRA, LLaMA-Pro 등 다양한 효율적 파인튜닝 기법을 통합하여, 메모리 소모를 줄이고 훈련 효율성을 높인다.
기술적 접근법
- **모델 지원**: 350+ LLM, 80+ MLLM (예: Qwen2.5-VL, InternVL3, GLM4-V).
- **후처리 기술 통합**: 추론, 평가, 양자화 (LoRA, LLaMA-Pro, rsLoRA 등).
- **평가 프레임워크**: EvalScope를 통해 OpenCompass와 VLMEvalKit을 결합.
- **커스텀 평가**: CEval 형식 CSV, ROUGE/BLEU 기반 QA 평가.
- **배포 백엔드**: vLLM, LMDeploy 등 다양한 추론 엔진 지원.
- **인터페이스**: 커맨드라인 기반의 웹 UI 제공, 사용자 편의성 향상.
주요 결과
- **모델 지원 수치**: 350개 이상의 LLM, 80개 이상의 MLLM.
- **평가셋 지원**: 100개 이상의 텍스트 및 멀티모달 평가셋.
- **커스텀 평가**: CEval 형식, ROUGE/BLEU 기반 QA 평가.
- **후처리 기술**: LoRA, LLaMA-Pro, rsLoRA 등 다양한 기법 통합.
- **배포 유연성**: vLLM, LMDeploy 등 다양한 백엔드 지원.
의의 및 한계
SWIFT는 대형 언어 모델 및 멀티모달 모델의 파인튜닝, 평가, 배포를 통합한 최초의 오픈소스 인프라로, 개발자들이 다양한 기술과 모델을 쉽게 결합할 수 있도록 지원한다. 특히, MLLM에 대한 체계적인 지원은 기존 프레임워크에서 부족했던 부분을 보완한다. 그러나 개발 시간의 제약으로 Megatron 대규모 병렬 훈련, 멀티모달 데이터셋 및 모델 연구, RAG 시스템 지원 등은 아직 미비하며, 향후 확장이 필요하다.
실용적 활용
SWIFT는 연구자들이 다양한 LLM과 MLLM을 효율적으로 파인튜닝하고, 실제 애플리케이션에 적용할 수 있도록 지원한다. 특히, 멀티모달 모델(Qwen2.5-VL, InternVL3 등)을 활용한 이미지-텍스트 QA, 이미지 생성, 객체 인식 등에 유용하며, LoRA 기반의 저비용 파인튜닝 기술을 활용한 산업 현장 적용이 가능하다.