한 줄 요약
AI 에이전트가 SAE 도구를 활용해 자율적으로 모델 해석 연구를 수행할 수 있는지 평가하는 벤치마크인 SAEScientist-Bench를 제안한다.
핵심 기여도
- 20개의 다양한 개념 도메인을 포함한 131K+ 특징 사전(Gemma-2-9B-IT)에서 AI 에이전트가 대상 개념을 탐색하는 20개의 자율적 발견 태스크를 정의.
- Neuronpedia 기반의 전문가 기준 특징과 비교하는 평가 프레임워크를 제시: activation rank, activation selectivity, causal steering.
- 10개의 최첨단 에이전트(예: Kimi K3, Claude Opus 5, Grok 4.6)를 평가하여 각 에이전트의 강점과 한계를 분석.
- 에이전트가 실험적 측정을 잘못 해석하거나 형식과 개념을 구분하지 못하는 행동 패턴을 밝혀냄.
핵심 아이디어
기존 자율 AI 연구는 모델 훈련 파이프라인 자동화에 집중했으나, 모델 내부 메커니즘을 이해하고 안전하게 정렬시키는 것은 여전히 미비한 영역이다. 이 연구는 **Sparse Autoencoder (SAE)** 도구를 활용한 자율적 해석 연구를 수행할 수 있는 AI 에이전트의 능력을 평가하는 **SAEScientist-Bench**를 제안한다. 에이전트는 주어진 개념에 대해 대조 실험(probes)을 설계하고, **Gemma-2-9B-IT** 모델의 **131K+ 특징 사전**을 탐색하여 최적의 SAE 특징을 선택한다. 이 과정은 **activation rank**, **activation selectivity**, **causal steering** 세 가지 평가 지표를 통해 전문가 기준(Neuronpedia)과 비교된다. 핵심 통찰은 실험적 증거를 정확히 해석하고 유의미한 대조 실험을 설계하는 능력이 자율적 발견의 핵심이라는 점이다.
기술적 접근법
- **Gemma-2-9B-IT** 모델의 **131K+ SAE 특징 사전**을 탐색하는 에이전트 시스템.
- **Contrastive probe** 설계: 대상 개념과 대조 개념을 구분하는 실험적 쿼리 생성.
- **Post-submission validation**: 제출된 특징 ID에 대해 **activation rank**, **activation selectivity**, **causal steering** 평가.
- **Causal steering**은 **greedy generation**을 통해 수행되며, **α** 값은 **held-out prompts** 기반의 비감소 조건에 따라 결정.
- 평가 시 **GPT-4o** 자동 판별기로 **anonymized output triplets** (기준, 조정, 랜덤)을 평가.
- 각 태스크당 **3회 독립 실험**을 수행하며, 평균 점수와 표준 편차(±)를 보고.
주요 결과
- **Kimi K3**가 10개 에이전트 중 종합 점수 1위 (92.91/100), **Claude Opus 5**와 **Sonnet 5**가 뒤를 이음.
- **Activation selectivity**에서 Kimi K3는 전문가 기준(98.92)에 근접한 92.91 점수 달성.
- **Causal steering**에서는 에이전트 최고 점수 31.47 (전문가 기준 57.75), 62.7% 낮음.
- **Grok 4.6**은 steering efficacy에서 1위, **Claude Opus 5**는 activation rank에서 1위.
- 에이전트는 대조 실험 설계는 잘 수행하지만, 실험 측정 해석을 자주 오독하고, 형식과 개념을 구분하지 못함.
의의 및 한계
SAEScientist-Bench는 자율 AI 연구에서 **실험적 모델 이해**를 측정 가능한 능력으로 정의하고, **SAE 기반 해석 도구**와 **자율 연구 에이전트** 간의 상호작용을 체계적으로 평가하는 첫 번째 시도이다. 이는 **Recursive Self-Improvement (RSI)** 루프 내에서 안전하고 신뢰할 수 있는 모델 발전을 가능하게 하는 기초를 제공한다. 그러나, 에이전트는 여전히 **causal steering** 능력에서 전문가 수준에 크게 못 미치며, **실험적 증거 해석**과 **개념-형식 구분**에서 한계를 보인다. 이는 자율 AI 연구에서 **실험 설계 능력**과 **해석 정확도**가 핵심 과제임을 시사한다.
실용적 활용
이 연구는 **자율 AI 연구 플랫폼**, **모델 해석 툴 개발**, **안전성 검증 시스템** 등에 활용 가능하다. 특히, **Gemma-2-9B-IT**와 같은 대규모 사전 학습 모델의 내부 메커니즘을 이해하고, **안전한 정렬**(safe alignment)을 보장하기 위한 **실험 기반 모델 감사**(model auditing) 시스템 개발에 기여할 수 있다.