한 줄 요약
GRASP는 강화학습 기반의 다단계 추론을 위한 적응형 검색 정책으로, 의미 검색, 키워드 검색, 단락 읽기 동작을 조율한다.
핵심 기여도
- GRASP는 강화학습을 활용해 의미 검색, 키워드 검색, 단락 읽기 동작을 조율하는 정책을 학습한다.
- 정책 학습에 사용된 보상은 정답 정확도, 기반 읽기, 보완 검색, 턴 효율성을 종합적으로 반영한다.
- HotpotQA, 2WikiMultiHopQA, MuSiQue 데이터셋에서 단일 단계 검색, 프롬프트 기반, 강화학습 기반 기존 방법 대비 검색 리콜 및 QA 성능을 개선한다.
- 키워드 검색 제거 시 EM/F1이 10% 이상 감소하는 등 의미 검색의 중요성이 입증된다.
핵심 아이디어
기존 RAG 시스템은 단일 단계에서 고정된 검색 전략을 사용하는 반면, GRASP는 다단계 추론 과정에서 동적으로 검색 전략을 조율하는 정책을 학습한다. 이는 의미 검색(semantic search), 키워드 검색(keyword search), 단락 읽기(paragraph reading)의 세 가지 동작을 조합하여, 필요 시만 추가 문맥을 확장하는 방식이다. GRASP는 강화학습을 통해 정책을 학습하며, 정책의 선택은 각 단계에서의 상태(state)에 따라 달라진다. 예를 들어, 초기 단계에서는 의미 검색을 통해 넓은 범위의 정보를 탐색하고, 후반 단계에서는 단락 읽기를 통해 구체적인 증거를 검증한다. 이는 기존 RAG가 단일 검색 전략에 의존하거나, 문맥이 너무 거친 경우 발생하는 홀로스테이션(hallucination) 문제를 완화할 수 있다.
기술적 접근법
- **모델**: Qwen/Qwen2.5-3B-Instruct 모델을 정책 학습에 사용.
- **강화학습 프레임워크**: 유한 시간 범위의 마르코프 결정 과정(MDP)으로 모델링. 상태(state)는 질문, 상호작용 히스토리, 이전 검색 증거, 남은 턴 수로 구성.
- **동작(action)**: 의미 검색, 키워드 검색, 단락 읽기.
- **보상(reward)**: 정답 정확도, 기반 읽기, 보완 검색, 턴 효율성을 종합적으로 반영.
- **학습 알고리즘**: 정책 기반 강화학습을 사용하여, 각 단계에서의 동작 선택을 최적화.
- **하이퍼파라미터**: 학습 데이터는 HotpotQA의 5,500개 샘플로, 2에포크 동안 학습.
주요 결과
- **HotpotQA**: GRASP는 단일 단계 검색 대비 EM +10.2%, F1 +9.7% 개선.
- **2WikiMultiHopQA**: EM +8.5%, F1 +7.8% 개선.
- **MuSiQue**: EM +9.1%, F1 +8.3% 개선.
- **보완 검색 실험**: 키워드 검색 제거 시 EM -10.5%, 의미 검색 제거 시 EM -14.2% 감소.
- **문맥 세분화 실험**: 단락 전체를 검색할 경우, 후속 질문이 원 질문과 유사하게 생성되어 타겟팅이 약화됨.
의의 및 한계
GRASP는 다단계 추론 과정에서 동적으로 검색 전략을 조율하는 정책 학습을 가능하게 하며, 이는 기존 RAG 시스템의 단점인 홀로스테이션 및 문맥 불확실성을 줄이는 데 기여한다. 특히, 의미 검색과 키워드 검색의 보완적 사용을 통해, 개념 수준의 탐색과 구체적 증거 검증을 동시에 수행할 수 있다. 그러나 GRASP는 학습에 필요한 데이터셋이 핸드라벨링된 지원 단락(grounded paragraph)에 의존하며, 이는 실용적 적용 시 어려움이 있을 수 있다. 또한, 학습 과정에서의 계산 비용이 높아, 대규모 데이터셋에서의 학습은 여전히 도전 과제이다.
실용적 활용
GRASP는 복잡한 질문에 대한 다단계 추론이 필요한 의료, 법률, 금융 분야의 정보 추출 시스템에 적용 가능하다. 또한, 대규모 지식 기반을 활용한 챗봇이나 개인화된 추천 시스템에서도 유용하게 사용될 수 있다.