한 줄 요약
G-Retriever는 텍스트 속성 그래프에서 질의 응답을 위한 RAG 기반 프레임워크로, hallucination 저감과 확장성을 실현한다.
핵심 기여도
- **GraphQA 벤치마크** 도입: 실제 세계 그래프 질문 응답을 위한 다목적 데이터셋 제공.
- **G-Retriever** 제안: 텍스트 그래프에 최적화된 RAG 프레임워크로, **Prize-Collecting Steiner Tree** 최적화를 통해 hallucination을 감소.
- **Llama2-7b**와 **Graph Transformer**를 활용한 실험에서 기존 베이스라인 대비 **22.51%** 이상 성능 향상.
- **SentenceBert** 기반 인코딩으로 노드/엣지 속성을 효과적으로 처리.
핵심 아이디어
기존 연구는 그래프 분류나 소규모 그래프에 집중했으나, G-Retriever는 대규모 텍스트 그래프에서 질의 응답을 가능하게 한다. 핵심 아이디어는 **LLM의 hallucination 문제를 해결하기 위해 RAG를 도입**하고, **Prize-Collecting Steiner Tree (PCST)** 최적화를 통해 그래프 내 관련 정보만 선택적으로 검색하는 것이다. 이는 기존 RAG가 단순 텍스트나 지식 그래프에만 적용된 것과 달리, **일반 텍스트 그래프 구조에 맞춘 새로운 접근법**이다. 또한, **Graph Transformer**와 **SentenceBert**를 결합하여 텍스트와 임베딩 형태로 그래프를 표현함으로써, 질의에 대한 이해도를 높인다.
기술적 접근법
- **GraphQA 벤치마크**: 실제 세계 그래프 질문 응답을 위한 데이터셋.
- **G-Retriever**:
- **SentenceBert**로 노드와 엣지 속성을 인코딩.
- **LLM (Llama2-7b)**과 **Graph Transformer**를 결합하여 질의 생성.
- **RAG**를 통해 그래프 내 관련 정보를 **Prize-Collecting Steiner Tree (PCST)** 최적화 문제로 모델링.
- **소프트 프롬프팅 (soft prompting)**을 통해 그래프 이해도 향상.
- **Graph Transformer**는 텍스트화된 그래프를 처리하는 역할.
주요 결과
- **GraphQA** 벤치마크에서 **G-Retriever**는 기존 베이스라인 대비 **22.51%** 성능 향상.
- **Llama2-7b** 기반 실험에서 **hallucination 감소**를 확인.
- **대규모 그래프**에서도 성능 저하 없이 확장 가능.
- **Graph Transformer** 제거 시 **19.19%** 성능 감소, 텍스트화된 그래프 제거 시 **22.51%** 감소.
의의 및 한계
G-Retriever는 텍스트 속성 그래프에서 질의 응답을 가능하게 하며, **LLM의 hallucination 문제를 완화**하고 **대규모 그래프 처리를 가능하게** 한다는 점에서 학술적·실용적 가치가 있다. 특히, **PCST 기반의 RAG**는 기존 방법과 차별화된 접근법으로, 그래프 구조를 고려한 정보 검색을 가능하게 한다. 그러나 현재 **정적 retrieval 구성요소**를 사용하고 있어, **동적 학습 가능한 RAG 구조**로의 확장이 필요하다는 한계가 있다.
실용적 활용
G-Retriever는 **지식 그래프 추론**, **실내 장면 이해**, **추천 시스템**, **전자상거래 네트워크 분석** 등 다양한 산업 분야에서 활용 가능하다. 특히, **대규모 텍스트 그래프를 처리해야 하는 상황**에서 유용하며, **사용자가 그래프와 대화형으로 상호작용**할 수 있도록 지원한다.