한 줄 요약
HippoRAG 2는 인간 장기 기억의 동적 구조를 반영한 RAG 시스템으로, 7%의 연관 기억 성능 향상을 달성한다.
핵심 기여도
- HippoRAG 2는 Personalized PageRank 알고리즘과 더 깊은 패스지 통합을 결합하여, 기존 RAG 시스템의 한계를 극복.
- 2Wiki와 LV-Eval 데이터셋에서 NV-Embed-v2 대비 9.5%와 3.1%의 F1 성능 향상.
- MuSiQue와 2Wiki 데이터셋에서 Recall@5 성능이 각각 5.0%와 13.9% 개선.
- 개방형 및 프로퍼티 LLM 모두에서 유연한 성능을 보임.
핵심 아이디어
기존 RAG 시스템은 벡터 기반 검색에 의존해 인간의 장기 기억과 같은 동적이고 연결된 구조를 모방하지 못한다. HippoRAG 2는 인간 뇌의 기억 형성 방식을 모방한 Personalized PageRank 알고리즘을 기반으로, 패스지 간의 관계를 그래프 구조로 표현하고 이를 기반으로 다중 훅 추론을 수행한다. 특히, 쿼리 기반의 컨텍스트화를 강화하여, KG 트리플 선택 과정에 쿼리를 깊이 참여시키고, 온라인 검색 과정에서 LLM을 활용해 불필요한 트리플을 필터링한다. 이는 단순한 벡터 검색을 넘어, 의미적 연결성을 강화하는 데 기여한다.
기술적 접근법
- **Personalized PageRank (PPR)**: HippoRAG 2는 PPR 알고리즘을 사용해 패스지 간의 연결성을 그래프로 표현.
- **Query-to-triple linking**: 쿼리를 기반으로 KG 트리플을 선택하여, 쿼리와 관련된 정보만 검색.
- **Online LLM 활용**: 검색 과정에서 LLM을 실시간으로 사용해 불필요한 트리플을 필터링.
- **OpenIE 활용**: 패스지 간의 관계를 추출하여 KG를 구성.
- **Triple filtering**: NER-to-node, query-to-node, query-to-triple 방식 중 query-to-triple이 가장 효과적임을 실험적으로 검증 (Recall@5 +12.5%).
주요 결과
- **2Wiki 데이터셋**: HippoRAG 2는 NV-Embed-v2 대비 9.5% F1 성능 향상.
- **LV-Eval 데이터셋**: HippoRAG 2는 NV-Embed-v2 대비 3.1% F1 성능 향상.
- **MuSiQue 데이터셋**: HippoRAG 2는 NV-Embed-v2 대비 Recall@5 5.0% 개선.
- **2Wiki 데이터셋**: HippoRAG 2는 NV-Embed-v2 대비 Recall@5 13.9% 개선.
- **Associative memory task**: HippoRAG 2는 기존 최고 성능 모델 대비 7% 개선.
의의 및 한계
HippoRAG 2는 인간의 장기 기억 구조를 반영한 RAG 시스템으로, 기존 RAG의 단순 벡터 검색에 의존한 한계를 극복하고, 의미적 연결성을 강화한 첫 시도이다. 특히, 연관 기억, 사실 기억, 의미 생성 기억을 모두 포괄적으로 개선한 점에서 학술적 의의가 크다. 그러나, 모든 RAG 시스템과 마찬가지로, 패스지의 질과 수량에 크게 의존하며, 대규모 KG 구축에 필요한 계산 비용이 높다는 한계가 있다. 또한, 쿼리 기반 필터링 과정에서의 오류 가능성도 남아 있다.
실용적 활용
HippoRAG 2는 대규모 지식 기반을 필요로 하는 법률, 의료, 연구 분야에서 지속 학습을 지원하는 RAG 시스템으로 활용 가능하다. 특히, 다중 훅 추론이 필요한 복잡한 QA 시나리오에서 유용하며, 개방형 및 프로퍼티 LLM 모두에서 사용할 수 있어 산업 현장에서의 유연한 적용이 가능하다.