한 줄 요약
Patchscopes는 LLM 내부 표현을 해석하기 위한 통합적이고 유연한 프레임워크로, 기존 방법의 한계를 극복하고 새로운 해석 가능성과 오류 수정 기능을 제공한다.
핵심 기여도
- 기존 해석 방법(예: vocabulary projection, computation intervention)을 Patchscopes라는 통합 프레임워크로 재구성.
- Patchscopes는 early layer 분석 실패, 표현력 부족 등의 기존 문제를 해결.
- Patchscopes를 사용한 multi-hop reasoning 오류 수정 실험에서 50% 정확도 달성 (기존 chain-of-thought 대비 +14.29%).
- Vicuna 7B 대비 Vicuna 13B를 타겟 모델로 사용할 경우, Patchscope의 표현력이 향상됨.
핵심 아이디어
Patchscopes는 LLM이 생성하는 자연어를 활용해 모델 내부 표현을 해석하는 프레임워크이다. 기존 방법은 표현을 단어 공간으로 투영하거나 계산에 개입하는 방식이었으나, Patchscopes는 특정 정보를 추출하도록 설계된 다른 프롬프트에 활성화 정보를 '패치(patch)'하여 해석한다. 이는 기존 activation patching 기법을 확장한 것으로, 다양한 해석 목적에 따라 구성 가능한 inspection tool로 활용된다.
예를 들어, "tok1 → tok1; tok2 → tok2; …" 형식의 few-shot 프롬프트를 사용하면, 토큰 ID 예측 성능이 vocabulary projection 방법 대비 크게 향상된다. 또한, Patchscopes는 훈련 데이터 없이도 12개의 common sense 및 사실 추론 작업 중 6개에서 probing 방법을 초과하는 성능을 보인다.
기술적 접근법
- **Patching**: 특정 레이어와 위치의 활성화 정보를 다른 모델의 계산 과정에 삽입.
- **Mapping Function**: 투영 함수로는 identity, affine, 또는 복잡한 함수 사용 가능.
- **Token Identity Patchscope**: 토큰 ID 예측을 위한 few-shot 프롬프트 사용 (예: `tok1 → tok1; tok2 → tok2`).
- **Logit Lens**: identity mapping을 사용한 기존 방법.
- **Tuned Lens**: 선형 회귀를 통해 중간 레이어와 최종 레이어 간 affine 매핑 학습.
- **Cross-model Patching**: 더 강력한 모델(Vicuna 13B)을 사용해 작은 모델(Vicuna 7B)의 표현 해석.
주요 결과
- **Next-token 예측**: Token Identity Patchscope는 여러 LLM에서 vocabulary projection 방법 대비 훨씬 높은 Precision@1 성능을 보임.
- **Attribute decoding**: 12개의 common sense 및 사실 추론 작업 중 6개에서 probing 대비 훨씬 높은 성능 (정확도 +10% 이상).
- **Multi-hop reasoning 오류 수정**: Patchscope는 50% 정확도 달성 (chain-of-thought: 35.71%, vanilla generation: 19.57%).
- **Entity resolution 분석**: "Alexander the Great" 입력에서 early layer에서 "Great Britain", "the Great Depression" 등 오해 정보를 추출 가능.
의의 및 한계
Patchscopes는 기존 해석 방법을 통합하면서도 새로운 해석 가능성(예: cross-model inspection, multi-hop 오류 수정)을 제공한다. 특히, 훈련 데이터 없이도 높은 성능을 보이는 점에서 실용적 가치가 크다. 또한, early layer 분석 실패 문제를 해결함으로써 LLM의 내부 작동 메커니즘을 더 깊이 이해할 수 있다.
그러나, Patchscopes는 패치된 정보가 원본 프롬프트의 문맥과 분리되기 때문에, 일부 정보는 재구성되지 않을 수 있다. 또한, 패치된 계산 이후의 정보가 원래 표현에 포함되어 있지 않을 수 있으므로, 모든 정보를 정확히 복원하지는 못한다.
실용적 활용
Patchscopes는 LLM의 내부 작동 메커니즘을 해석하고, 오류를 수정하는 데 유용하게 활용될 수 있다. 예를 들어, 교육, 의료, 법률 분야에서 모델의 결정 과정을 설명하거나, 모델의 신뢰성을 높이기 위한 디버깅 도구로 사용 가능하다. 또한, 더 강력한 모델을 활용해 작은 모델의 내부 표현을 해석하는 cross-model inspection 기법은 모델 개발 및 최적화에도 기여할 수 있다.