한 줄 요약
대형 언어 모델의 생성물에 포함된 오류를 토큰 수준 불확실성 측정을 통해 탐지하는 새로운 팩트체킹 파이프라인을 제안한다.
핵심 기여도
- **Claim Conditioned Probability (CCP)**라는 새로운 토큰 수준 불확실성 측정 방법을 제안하여, 7개 LLM과 4개 언어에서 기존 기법 대비 0.07~0.09 ROC-AUC 개선을 달성.
- CCP는 생성된 문장 내 특정 주장의 불확실성만 측정하며, 표면형식과 주장 유형 선택에 따른 불확실성을 제거.
- FactScore 기반 생체 생성 데이터셋에서 CCP가 기존 기법보다 높은 성능을 보임.
- CCP는 LLM 추론 시간의 최대 3%만 추가 소요되어 계산 효율적임.
핵심 아이디어
대형 언어 모델은 생성물에 자주 **hallucination**(오류)를 포함시키며, 이는 사용자가 정확한 정보를 식별하는 데 어려움을 줌. 기존 팩트체킹 시스템은 외부 지식을 필요로 하며, 계산 비용이 높고 불완전한 경우가 많다. 본 연구는 **LLM 자체 출력 내에 포함된 정보만으로** 오류를 탐지할 수 있는 새로운 접근법을 제안한다.
핵심 아이디어는 **토큰 수준의 불확실성**(Uncertainty Quantification, UQ)을 측정하여, 생성된 문장 내 특정 주장(claim)의 신뢰도를 평가하는 것이다. 기존 방법은 전체 문장 수준의 불확실성을 측정하는 데 초점을 맞추었으나, 본 연구는 **개별 주장 수준**(claim-level)의 불확실성을 추출한다. 이를 위해 **Claim Conditioned Probability (CCP)**라는 새로운 메트릭을 제안하며, 이는 모델이 특정 주장 값을 표현할 때의 불확실성만을 측정한다. CCP는 표면형식(surface form)이나 주장 유형 선택에 따른 불확실성을 제거하여, **정확한 오류 탐지**를 가능하게 한다.
기술적 접근법
- **Claim Conditioned Probability (CCP)**: 토큰 수준의 불확실성을 측정하는 새로운 메트릭.
- CCP는 각 단어에 대해, 해당 단어가 특정 주장에 포함될 경우의 확률을 조건부 확률로 계산.
- 표면형식과 주장 유형 선택에 따른 불확실성은 제거.
- **NLI 모델 활용**: 주장과 문맥 간 관계를 분석하는 Natural Language Inference (NLI) 모델을 사용.
- 22M 파라미터의 소규모 NLI 모델도 성능 저하 없이 사용 가능.
- **문장 내 단어 집합 처리**: CCP는 문장 내 단어 집합을 처리하며, 기능어(functional words)를 제외하면 성능이 0.03 ROC-AUC 향상.
- **대안 수 K**: CCP는 K=8개의 대안을 사용할 때 최적 성능을 보임. K=5로 줄이면 0.02 ROC-AUC 감소.
- **문장 수 증가에 따른 성능 저하**: 생성된 문장 수가 늘수록 CCP 포함 모든 방법의 성능이 감소. 이는 모델이 앞부분에 신뢰도 높은 정보를 포함하고, 뒷부분에 복잡한 정보를 생성하기 때문.
주요 결과
- **FactScore 데이터셋**에서 CCP는 7개 LLM(예: GPT-3.5-turbo, GPT-4, Jais 13b 등)과 4개 언어(영어, 중국어, 아랍어, 러시아어)에서 기존 기법 대비 **0.07~0.09 ROC-AUC 개선**.
- **Jais 13b** 모델에서 CCP는 가장 가까운 경쟁자 대비 0.07 ROC-AUC, 0.09 PR-AUC 개선.
- **GPT-3.5-turbo**에서는 CCP가 PR-AUC에서 P(True) 기법에 밀려 1위를 기록하지 못함.
- **인간 평가**에서 CCP 기반 팩트체킹 파이프라인은 외부 지식을 사용하는 FactScore와 유사하거나 더 높은 성능을 보임.
- **추론 시간**은 CCP가 LLM 추론 시간의 최대 3%만 추가 소요됨.
의의 및 한계
- CCP는 외부 지식 없이도 LLM 자체 출력 내 정보만으로 팩트체킹이 가능하며, 기존 시스템 대비 **비용과 복잡도가 낮음**.
- **생체 생성**(biography generation) 데이터셋에서 CCP는 7개 LLM과 4개 언어에서 일관된 성능을 보임.
- 한계로는 **GPT-3.5-turbo**의 경우 OpenAI API에서 제공되는 토큰 로짓 수가 제한되어 CCP 성능이 저하될 수 있음.
- 생성된 문장 수가 증가할수록 CCP 포함 모든 방법의 성능이 감소하며, 이는 모델이 복잡한 정보를 생성할 때 발생하는 불확실성 때문.
실용적 활용
- CCP는 **의료, 법률, 뉴스 생성 등 정확도가 중요한 분야**에서 LLM의 신뢰도를 평가하는 데 활용 가능.
- **LLM 기반 챗봇이나 정보 제공 서비스**에 적용하여 사용자에게 오류가 포함된 정보를 경고할 수 있음.
- **LM-Polygraph 라이브러리**를 통해 CCP는 다른 투명한 LLM에도 적용 가능하며, 연구 및 산업 현장에서 즉시 활용 가능.