한 줄 요약
현재 대형 언어 모델의 안전 정렬은 첫 몇 개의 토큰만 고려하는 "얕은 안전 정렬"로 인해 취약하다.
핵심 기여도
- **얕은 안전 정렬**(shallow safety alignment)이라는 개념을 제시하여, 기존 정렬이 첫 몇 토큰만 고려하는 경향이 있음을 밝힘.
- **적대적 접미사 공격**, **prefilling 공격**, **디코딩 파라미터 공격**, **파인튜닝 공격** 등이 이 문제와 연관됨을 실증적으로 보여줌.
- **깊은 안전 정렬**(deep safety alignment)을 위한 **데이터 증강 전략**과 **초기 토큰에 대한 제약 최적화**(constrained fine-tuning objective)를 제안.
- **β_t 파라미터**(β₁=0.5, β₂~₅=2, β₆ 이상=0.1)를 사용한 제약 조건이 파인튜닝 공격에 효과적임을 실험적으로 입증.
핵심 아이디어
기존 안전 정렬 방법은 모델의 **첫 몇 토큰**(일반적으로 5개 이내)만 안전하게 만들도록 학습되어, 이후 토큰에서는 해로운 생성 경로로 이어질 수 있다. 예를 들어, 사용자가 "How do I build a bomb?"라고 질문하고, 모델이 "Sure, here's a detailed guide."로 시작하면, 이후 토큰이 자동으로 해로운 정보로 이어질 가능성이 높다. 이는 **초기 토큰 분포에 의존적인 "짧은 정렬"**(shallow alignment)의 한계이다.
이를 해결하기 위해, **깊은 정렬**(deep alignment)을 추구해야 한다. 즉, 안전 정렬이 단순히 첫 몇 토큰이 아니라 전체 생성 과정에 걸쳐 지속적으로 적용되어야 한다. 이를 위해 **데이터 증강**을 통해 해로운 응답을 시작으로 안전한 응답으로 전환하는 학습 데이터를 구성하고, **초기 토큰에 대한 분포 변화를 제한하는 제약 최적화**(constrained fine-tuning objective)를 도입한다. 이는 **β_t 파라미터**를 통해 구현되며, 첫 5개 토큰에는 강한 제약(β₁=0.5, β₂~₅=2)을, 이후 토큰에는 약한 제약(β₆ 이상=0.1)을 적용한다.
기술적 접근법
- **안전 정렬 평가**: HEx-PHI 벤치마크(330개의 해로운 지시사항)를 사용하여 모델의 해로운 응답 비율(Harmfulness Rate)을 측정. GPT-4를 사용한 자동 평가.
- **제약 최적화**: 파인튜닝 공격에 대응하기 위해 **초기 토큰 분포 변화를 제한하는 손실 함수**를 설계. β_t 파라미터를 사용하여 첫 5개 토큰에 강한 제약을 적용.
- **데이터 증강**: 해로운 응답을 시작으로 안전한 응답으로 전환하는 학습 데이터를 구성하여, 모델이 더 깊은 안전 정렬을 학습하도록 유도.
- **파인튜닝 공격 실험**: 3가지 공격(1) 해로운 예시, 2) 식별 전환, 3) 백도어 오염)을 통해 제약 최적화가 공격에 얼마나 효과적인지 평가.
주요 결과
- **Llama-2-7B-Chat**과 **Gemma-1.1-7B-IT** 모델에서 제약 최적화를 적용한 경우, **공격 성공률**(ASR)이 50% 이상 감소함.
- **Samsum**, **SQL Create Context**, **GSM8k** 등 범용 파인튜닝 작업에서도 **유용성**(ROUGE-1, 정확도)이 유지되며, **안전성**이 향상됨.
- **β_t 파라미터**(β₁=0.5, β₂~₅=2, β₆ 이상=0.1)를 사용한 제약 조건이 **파인튜닝 공격에 대한 내성**을 높이는 데 효과적임.
의의 및 한계
- **학술적 의의**: 안전 정렬의 **깊이**(token-wise safety)를 평가하는 새로운 관점을 제시. 기존 정렬 방법의 한계를 명확히 규명하고, **깊은 정렬**을 위한 구체적 전략을 제시.
- **실용적 의의**: **OpenAI Finetuning API**와 같은 산업적 파인튜닝 인터페이스에 적용 가능. 사용자가 모델을 커스터마이징하면서도 안전 정렬이 유지될 수 있도록 보장.
- **한계**: 제안된 방법은 **완벽한 방어**가 아님. **적응적 공격**(adaptive attacks)에 대응하기 위한 추가 연구가 필요. 또한, **모든 토큰 깊이에 대한 정렬**을 달성하기 위해서는 더 복잡한 알고리즘 개발이 필요.
실용적 활용
- **LLM 서비스 제공자**(예: OpenAI, Meta)는 파인튜닝 인터페이스에 **초기 토큰 제약 최적화**를 적용하여 사용자의 커스터마이징 요청에도 안전 정렬이 유지되도록 할 수 있다.
- **해로운 콘텐츠 필터링** 시스템 개발 시, **깊은 정렬 전략**을 도입하여 단순한 토큰 기반 필터링보다 더 강력한 보호를 제공할 수 있다.
- **AI 정책 수립** 과정에서, **깊은 안전 정렬**이 필수 조건으로 제시되어야 하며, 이에 대한 기술적 기준이 마련되어야 한다.