한 줄 요약
"Representation Rerouting" 기반의 Circuit Breakers가 LLM과 멀티모달 모델의 해로운 출력을 억제하면서도 성능 저하 없이 공격에 강한 안정성을 제공한다.
핵심 기여도
- **Circuit Breakers**를 통해 모델 내부 표현을 조절하여 해로운 출력 자체를 방지함.
- **Representation Rerouting (RR)** 알고리즘을 통해 해로운 출력을 약 2개의 수준(2 orders of magnitude) 줄임.
- **Llama-3-8B-Instruct** 기반의 Cygnet 모델은 기존 방식 대비 공격에 더 강하고, 성능 저하 없이 안정성을 확보함.
- 멀티모달 모델에서도 **이미지 기반 공격(PGD)**에도 뛰어난 안정성을 보임.
핵심 아이디어
기존 방식(예: refusal training, adversarial training)은 특정 공격에 대응하는 방식이었으나, Circuit Breakers는 모델이 해로운 출력을 생성하는 **내부 표현**(representation)을 직접 조절함으로써 문제의 근본 원인을 제거한다. 이는 **representation engineering**(RepE) 기반의 접근법으로, 모델이 해로운 출력을 생성하는 순간에 해당 표현을 중단시켜 생성을 멈추는 방식이다. 이는 공격에 무관하게 작동하며, 추가적인 트레이닝이나 보조 모델 없이도 가능하다.
**Representation Rerouting (RR)** 알고리즘은 해로운 출력과 관련된 내부 표현을 특정 랜덤 벡터와의 **cosine loss**를 최소화함으로써, 해로운 표현의 활성화를 억제한다. 이는 **ℓ2 거리 최소화** 실험과 비교했을 때 더 안정적인 결과를 보임.
기술적 접근법
- **Circuit Breakers**: 해로운 출력을 생성하는 내부 표현을 중단시키는 메커니즘.
- **Representation Rerouting (RR)**: 해로운 표현을 랜덤 벡터와의 cosine loss를 최소화하여 억제.
- **Cygnet 모델**: Llama-3-8B-Instruct 기반으로 RR을 적용한 fine-tuned 모델.
- **Circuit-breaking 레이어**: Llama-3-8B-Instruct의 10, 20번 레이어에서 수행.
- **Harmfulness Probes (HP)**: 해로운 표현의 활성화를 탐지하는 분류기. Linear 및 MLP 기반.
- **Loss 함수**: cosine loss가 ℓ2 loss보다 더 안정적임.
- **Train 데이터**: 해로운 요청(예: 폭탄 제조 지침)을 포함한 6개 카테고리로 구성.
주요 결과
- **Cygnet 모델**은 해로운 출력을 약 **2 orders of magnitude**(100배) 줄임.
- **Llama-3-8B-Instruct** 기반 모델에서 **PGD 공격**에도 뛰어난 안정성 유지.
- **Mistral-7B-Instruct**에서도 유사한 결과 관찰.
- **Harmfulness Probes (HP)**는 공격 성공률을 감소시키나, **RR 방식**보다 성능은 낮음.
- **WildChat 데이터셋**에서 FPR(거짓 긍정률)은 RR 기반 모델과 유사하게 유지됨.
의의 및 한계
Circuit Breakers는 기존 방식(예: refusal training, adversarial training)과 달리 특정 공격에 대응하는 것이 아니라, **모델이 자체적으로 해로운 출력을 생성하는 능력을 제거**함으로써 보다 근본적인 해결책을 제시한다. 특히, **PGD 공격**에 대한 내성이 뛰어나며, 멀티모달 모델에서의 적용 가능성도 입증되었다.
그러나, **Harmfulness Probes**는 공격자가 해당 탐지기를 모르는 상황에서만 효과적이라는 한계가 있다. 또한, **Circuit Breakers의 정확한 작동 메커니즘**은 아직 완전히 밝혀지지 않았으며, 다양한 공격 상황에서의 일반화 능력은 추가 연구가 필요하다.
실용적 활용
이 연구는 **대형 언어 모델**(LLM)과 **멀티모달 시스템**에서의 해로운 출력 및 행동을 방지하는 데 유용하며, 특히 **보안이 중요한 산업**(예: 금융, 정부, 의료)에서의 AI 배포를 안정적으로 가능하게 한다. 또한, **AI 에이전트**(AI agent)의 해로운 행동 감소에도 적용 가능하며, **실시간 모니터링 및 보호 시스템**과의 통합 가능성도 높다.