한 줄 요약
LLMs는 내부 표현에 사실성 정보를 다량 포함하고 있으나, 이 정보는 특정 토큰에 집중되어 있으며, 태스크별로 일반화되지 않는다.
핵심 기여도
- LLMs의 내부 표현에서 사실성 정보가 특정 토큰(예: 정답 토큰)에 집중되어 있음을 발견하고, 이를 활용한 오류 탐지 성능이 향상됨.
- 오류 탐지기(예: probing classifier)가 태스크 간 일반화되지 않음을 밝혀, 사실성 인코딩이 다면적(multifaceted)임을 입증.
- 내부 표현을 활용해 오류 유형을 예측할 수 있음을 보여, 오류 완화 전략을 개선할 수 있음.
- 내부 표현과 외부 행동 간 불일치를 관찰: 정답이 내부에 인코딩되어 있어도, 모델은 일관되게 오답을 생성할 수 있음.
핵심 아이디어
LLMs는 내부 표현에 오류에 대한 정보를 풍부하게 포함하고 있지만, 이 정보는 단순히 전체 표현에 퍼져 있는 것이 아니라 특정 토큰(예: 정답 토큰)에 집중되어 있다는 점이 핵심 발견이다. 이는 기존의 오류 탐지 연구가 전체 표현을 사용한 반면, 본 연구는 정답 토큰에 집중함으로써 성능을 크게 향상시켰다. 또한, 오류 탐지기는 특정 태스크(예: 사실 추출)에서만 효과적이며, 다른 태스크(예: 감성 분석)에서는 일반화되지 않는다는 점에서, 사실성 인코딩이 "스킬-특이적(skill-specific)"임을 밝혔다. 이는 LLMs가 단일한 "보편적 사실성(universal truthfulness)"을 인코딩하지 않고, 다양한 태스크마다 다른 사실성 개념을 갖는다는 의미이다.
기술적 접근법
- **Probing classifier**: LLMs의 중간 표현(intermediate representations)을 사용하여 오류를 탐지하는 분류기.
- **정답 토큰(answer tokens)**: "The capital of Connecticut is Hartford"에서 "Hartford"와 같은 토큰에 사실성 정보가 집중됨.
- **Mistral-7b-instruct 모델**을 포함한 여러 LLMs와 10개의 데이터셋을 사용.
- **Error type 분류**: 반복 샘플을 기반으로 오류 유형(예: "mostly incorrect", "two competing answers")을 분류.
- **Logit-based uncertainty predictor**와 비교 실험을 통해 probing classifier의 성능을 평가.
주요 결과
- **Mistral-7b-instruct 모델**에서 probing classifier를 사용한 정답 선택이 오류 탐지 성능을 향상시킴.
- **"mostly incorrect"**, **"two competing answers"**, **"many answers"** 등 오류 유형에서 30~40 포인트의 정확도 향상 관찰.
- **"mostly correct"** 유형에서는 거의 개선 없음.
- 정답 토큰에 집중된 정보를 사용할 경우, 기존 방법 대비 오류 탐지 성능이 크게 향상됨.
- 내부 표현이 정답을 인코딩하고 있음에도 불구하고, 모델이 일관된 오답을 생성하는 경우가 있음.
의의 및 한계
본 연구는 LLMs의 내부 표현을 통해 오류를 이해하고 완화할 수 있음을 보여, 오류 분석의 새로운 접근법을 제시한다. 특히, 오류 유형을 예측함으로써 태스크별 맞춤형 완화 전략을 개발할 수 있다는 점에서 실용적 가치가 있다. 그러나, 오류 탐지기는 태스크 간 일반화되지 않으며, 이는 사실성 인코딩이 다면적임을 의미한다. 또한, 연구는 QA 태스크에 초점을 맞추었으며, open-ended 생성 작업에는 적용 범위가 제한된다. 이는 추후 연구에서 보완할 필요가 있다.
실용적 활용
의료, 법률 등 오류 감지가 중요한 분야에서, probing classifier를 활용해 오류 유형을 예측하고, 재샘플링된 응답 중 정답을 선택하는 방식으로 신뢰도를 높일 수 있다. 또한, 내부 표현 분석을 통해 LLMs의 내재된 지식을 활용한 오류 완화 전략을 개발할 수 있다.