한 줄 요약
Transcoders를 활용한 MLP 서브레이어 분석으로 GPT2-small의 "greater-than circuit"을 포함한 해석 가능한 LLM 회로를 발견한다.
핵심 기여도
- Transcoders를 도입하여 MLP 서브레이어를 신뢰성 있게 근사화하고, 입력-불변(input-invariant) 회로 분석을 가능하게 함.
- GPT2-small, Pythia-410M, Pythia-1.4B 모델에서 Transcoders가 SAE보다 해석성, 정확도, 스파스성에서 우수한 성능을 보임.
- GPT2-small에서 "greater-than circuit"이라는 새로운 회로를 역설계하여 해석적 통찰을 제공함.
- 회로 분석에서 입력-의존적(input-dependent)과 입력-불변 요소를 명확히 분리하는 구조를 제시함.
핵심 아이디어
기존의 SAE는 MLP 레이어의 해석을 위해 여러 뉴런의 선형 결합을 사용하지만, 이는 비선형성과 해석의 복잡성을 증가시킨다. Transcoders는 MLP 레이어를 넓은 스파스 활성화 MLP로 근사화하여, 해석 가능한 회로를 추출하는 새로운 접근법이다. 이는 입력-불변 정보와 입력-의존 정보를 분리하여, 회로의 일반적 행동을 이해할 수 있게 한다. Transcoder는 ReLU 활성화 함수를 사용하는 단일 은닉층 MLP이며, L1 정규화를 통해 스파스성을 유도한다. 이 구조는 MLP 레이어의 출력을 희소한 특징 벡터의 선형 결합으로 근사화한다.
기술적 접근법
- **Transcoder 아키텍처**: 입력 $ \mathbf{x} $, 인코더 가중치 $ \mathbf{W}_{enc} \in \mathbb{R}^{d_{\text{features}} \times d_{\text{model}}} $, 디코더 가중치 $ \mathbf{W}_{dec} \in \mathbb{R}^{d_{\text{model}} \times d_{\text{features}}} $, 그리고 편향 $ \mathbf{b}_{enc}, \mathbf{b}_{dec} $로 구성된다.
- **훈련 손실 함수**: $ \lambda_1 $ 하이퍼파라미터를 사용하여 정확도와 스파스성 간의 균형을 조절하는 손실 함수를 사용.
- **활성화 계산**: $ \mathbf{z}_{TC}(\mathbf{x}) $의 각 성분은 해당 특징의 활성도를 나타냄.
- **데이터셋**: GPT2-small, Pythia-410M, Pythia-1.4B 모델의 MLP-in 및 MLP-out 활성화를 기반으로 Transcoders를 훈련.
- **비교 대상**: SAE와 비교하며, 동일한 데이터셋(OpenWebText, 3.2M 토큰)에서 평가.
주요 결과
- **GPT2-small**: "greater-than circuit"이라는 새로운 회로를 역설계하여 해석적 통찰 제공.
- **모델 성능**: Transcoders는 SAE에 비해 스파스성, 정확도, 해석성에서 동등하거나 우수한 성능을 보임.
- **정확도**: Transcoders는 GPT2-small, Pythia-410M, Pythia-1.4B 모델에서 SAE 대비 동일하거나 더 낮은 손실(loss)을 보임.
- **스파스성**: Transcoders는 평균적으로 더 적은 수의 특징이 활성화됨 (L0 norm 기준).
의의 및 한계
- **의의**: Transcoders는 MLP 서브레이어를 포함한 회로 분석에서 입력-불변 정보를 분리할 수 있는 유일한 방법이며, 해석성과 정확도를 동시에 유지함.
- **한계**: 하이퍼파라미터 조정이 제한적이었으며, 더 많은 실험을 통해 SAE가 Transcoders를 능가할 수 있는 가능성도 존재함.
- **기존 접근법의 한계**: SAE는 입력-의존적 정보만 제공하며, MLP 내부의 비선형성과 복잡성을 해석하기 어려움.
실용적 활용
- **LLM 해석**: Transcoders는 GPT2, Pythia 등 대형 언어 모델의 내부 회로를 해석하여, 특정 기능(예: "greater-than circuit")의 작동 원리를 밝히는 데 활용 가능.
- **모델 디버깅**: 회로 분석을 통해 모델의 비정상적 행동을 추적하고, 디버깅 및 개선에 사용할 수 있음.
- **신경망 해석 연구**: Transcoders는 MLP 레이어를 포함한 복잡한 신경망 구조의 해석을 위한 새로운 도구로 활용 가능.