한 줄 요약
RAG를 활용한 대규모 언어 모델(RA-LLMs)의 연구 동향과 기술적 한계를 체계적으로 조사한 서베이 논문.
핵심 기여도
- RA-LLMs의 주요 기술적 관점(architecture, training strategy, application)을 체계적으로 분류하여 정리.
- 법학 분야에서 최신 LLMs의 hallucination 비율이 69%~88%에 달함을 인용하며 RAG의 필요성 강조.
- RAG 기반 대화 시스템에서 외부 지식을 통합함으로써 out-of-scope 질문에 대한 정확도 향상 사례 제시.
- MolReGPT, GPT-FAR 등 RA-LLMs의 실제 적용 사례를 구체적으로 언급.
핵심 아이디어
RAG는 외부 지식을 검색하여 생성 모델에 제공함으로써 생성 품질을 향상시키는 기술로, LLMs의 내재적 한계(예: hallucination, 오래된 지식)를 보완할 수 있다. 특히, 법학, 의학, 과학 분야에서는 최신 지식이 필수적이며, RAG는 이에 대한 해결책으로 제시된다. 예를 들어, MolReGPT는 RAG를 통해 ChatGPT의 분자 발견 능력을 향상시키는 사례로, RAG가 생성 모델의 in-context learning 능력을 강화할 수 있음을 보여준다. 또한, GPT-FAR은 이미지 태깅, 통계 분석, 텍스트 분석 등 멀티모달 작업에서 RAG를 활용한 사례로, RAG의 유연성과 적용 가능성을 강조한다.
기술적 접근법
- **RAG 아키텍처**: retriever-기반 검색 → context 생성 → generator-기반 생성의 3단계 구조.
- **Training Strategy**: 추가 학습 없이 retrieval 컴포넌트만 조정하여 다양한 생성 작업에 적용 가능.
- **Dataset**: OpenQA, 법학, 의학, 과학 분야의 최신 문서 기반 외부 지식베이스 활용.
- **LLM 기반 모델**: GPT-4, ChatGPT, MolReGPT 등이 RAG와 결합되어 사용됨.
- **하이퍼파라미터**: 명시되지 않음.
주요 결과
- 법학 분야에서 최신 LLMs의 hallucination 비율은 69%~88%로 매우 높음.
- RAG를 적용한 대화 시스템은 out-of-scope 질문에 대한 정확도가 향상됨.
- MolReGPT는 RAG를 통해 분자 발견 작업에서 ChatGPT의 성능을 향상시킴.
- GPT-FAR은 이미지 태깅, 통계 분석 등 멀티모달 작업에서 RAG를 성공적으로 적용.
의의 및 한계
RA-LLMs는 LLMs의 내재적 한계를 완화하고, 최신 및 신뢰할 수 있는 외부 지식을 통합함으로써 생성 품질을 향상시키는 데 중요한 역할을 한다. 특히, 법학, 의학, 과학 등 지식 집약적 분야에서 실용적 가치가 높다. 그러나 RA-LLMs 연구는 아직 초기 단계에 있으며, retrieval과 generation 간의 조화, 효율적인 학습 전략, 다양한 도메인에 대한 확장성 등의 문제는 여전히 남아 있다. 또한, 외부 지식베이스의 질과 업데이트 주기 또한 성능에 큰 영향을 미친다.
실용적 활용
RA-LLMs는 법학, 의학, 과학, 소프트웨어 엔지니어링 등 최신 지식이 필수적인 분야에서 대규모 언어 모델의 신뢰도와 정확도를 향상시키는 데 활용될 수 있다. 예를 들어, 법적 상담, 의료 진단, 과학적 QA 시스템, 소프트웨어 개발 문서 생성 등에서 RAG 기반 모델이 효과적으로 사용될 수 있다.