한 줄 요약
Gemma-4-E4B-it 모델에서 물리적 메커니즘 정보가 세 가지 형태로 분리 가능하며, Jacobian lens와 직접 읽기 기법을 통해 내부 표현을 분석하고 제어할 수 있음.
핵심 기여도
- Gemma-4-E4B-it 모델에서 개념은 개별 hidden state에 읽을 수 있으며, 3개의 독립적으로 적합한 Jacobian lens가 50개의 테스트 데이터에서 개념 순위를 재현함.
- 60개의 법칙을 포함한 반사적 벤치마크와 인과적 개입을 통해 내부 표현의 물리적 방향성을 분석함.
- 12개의 일치하는 사례에서 양방향 개입이 물리적으로 적절한 결과로의 답변 확률을 변화시킴.
- 72개의 프롬프트에서 메커니즘별 hidden-state 이웃 구조가 나타나나, 그래프 분석에서 수치적 비교와 동일하게 설명됨.
핵심 아이디어
기존의 LLM은 정확한 답변을 제공하더라도 내부 표현이 물리적 메커니즘을 반영하는지 여부를 밝히지 못한다. 본 연구는 Gemma-4-E4B-it 모델에서 물리적 메커니즘 정보가 세 가지 실험적으로 분리 가능한 형태로 존재함을 보인다. 첫째, 개별 hidden state에서 개념이 읽을 수 있으며, 둘째, 상태 간의 제어된 변환으로는 구성적 방향성이 전달되고, 셋째, 선택된 내부 표현이 엔지니어링 답변에 인과적으로 영향을 미친다. 이를 위해 Jacobian lens와 직접 읽기 기법을 결합하고, 60-law 반사적 벤치마크와 인과적 개입을 통해 내부 표현을 분석한다. 특히, 물리적 입력 방향만 반전된 동일한 프롬프트를 비교함으로써, 내부 상태 변화가 제시된 구성 법칙을 따르는지 확인한다.
기술적 접근법
- **Jacobian lens**: 중간 상태의 변화가 나머지 네트워크를 통해 평균적으로 어떻게 전달되는지를 추정하여, 동일한 고정된 디코더를 사용해 단어 순위를 생성함.
- **Direct unembedding**: 중간 상태를 최종 디코더에 직접 전달하여 단어 순위를 생성함.
- **Option-free state geometry**: 프롬프트의 단어 선택 없이 상태의 기하 구조를 분석함.
- **60-law counterfactual benchmark**: 60개의 법칙을 기반으로 반사적 실험을 수행함.
- **Causal interventions**: 내부 표현에 인과적 개입을 가해 답변 확률을 변화시킴.
- **Hidden-state neighborhoods**: 72개의 프롬프트에서 메커니즘별 hidden-state 구조를 분석함.
- **Neutral-anchored experiment**: 물리적 입력 방향만 반전된 동일한 프롬프트를 비교함.
주요 결과
- 50개의 테스트 데이터에서 3개의 독립적으로 적합한 Jacobian lens가 개념 순위를 재현함.
- 9/10의 메커니즘 가족이 타겟 없는 단어 집합을 통해 블라인드 식별됨.
- 60개의 고정 관계에서 39/40의 방향적 법칙이 올바르게 정렬됨.
- 12개의 일치하는 사례에서 양방향 개입이 물리적으로 적절한 결과로의 답변 확률을 변화시킴.
- 72개의 프롬프트에서 메커니즘별 hidden-state 이웃 구조가 나타나나, 수치적 비교와 동일하게 설명됨.
- 60-law 반사적 벤치마크에서 정확도는 53.8%에 달함.
의의 및 한계
본 연구는 LLM이 과학적 메커니즘을 내부적으로 표현하고 이를 제어할 수 있음을 보여주는 중요한 사례이다. 특히, Jacobian lens와 직접 읽기 기법을 통해 내부 표현을 분석하고, 인과적 개입을 통해 답변을 제어함으로써, LLM의 내부 작동 메커니즘을 더 깊이 이해할 수 있다. 그러나 일부 메커니즘은 직접 읽기보다 Jacobian lens가 효과적이지 않으며, 일부 프롬프트는 두 기법 모두에서 0의 변화를 보인다. 또한, 단어 집합만으로는 인과적 사용을 확정할 수 없으며, 일부 메커니즘은 수치적 비교와 동일하게 설명될 수 있다. 이는 LLM의 내부 표현이 항상 물리적 메커니즘을 반영하지는 않는다는 점을 시사한다.
실용적 활용
본 연구는 LLM의 내부 표현을 분석하고 제어하는 데 활용할 수 있으며, 특히 재료 과학 분야에서 모델의 신뢰성과 실패 진단에 기여할 수 있다. Jacobian lens와 인과적 개입 기법은 향후 강화 학습의 보상 신호 설계나 모델 훈련 목표 정의에 활용될 수 있으며, 과학적 결정이 맥락 변화에도 안정적으로 유지되는 AI 시스템 개발에 기여할 수 있다.