한 줄 요약
전향 마스크 검사가 누설을 누락하는 이유를 규명하고, 새로운 인과성 검증 방법을 제시한다.
핵심 기여도
- Prefix invariance를 정식화하여 위치 t의 표현이 미래 입력에 의존하지 않도록 정의.
- 2개의 순방향 패스만으로 인과성 위반을 정확히 특정하는 가벼운 감사 프로토콜 제안.
- 8개 체크포인트에서 192개의 주입 결함 시도에서 기존 마스크 검사가 0개를 찾은 반면, 제안 방법은 192/192개를 모두 감지.
- Zamba2와 Nemotron-H 모델에서 결함을 추가로 발견.
핵심 아이디어
기존의 어텐션 마스크 검사는 미래 정보 누설을 완전히 막지 못한다. 스캔이나 정규화 과정을 통해 누설이 발생할 수 있기 때문이다. 이 논문은 위치 t의 표현이 미래 입력에 의존하지 않아야 한다는 prefix invariance 원칙을 정식화하고, 이를 검증하기 위한 새로운 감사 프로토콜을 제시한다. 이 접근법은 훈련이나 그래디언트 없이 두 번의 순방향 패스만으로 인과성 위반을 정확히 특정할 수 있다.
기술적 접근법
- Prefix invariance: 위치 t의 표현이 미래 입력에 의존하지 않는 조건.
- 감사 프로토콜: 두 개의 순방향 패스를 통해 인과성 위반을 감지.
- 실험: 8개 체크포인트, 192개의 주입 결함 시도.
- 비교 대상: 기존의 어텐션 마스크 검사.
주요 결과
- 192개 주입 결함 시도에서 기존 마스크 검사는 0개를 감지.
- 제안 방법은 192/192개를 정확히 감지.
- Zamba2와 Nemotron-H 모델에서 추가 결함 발견.
의의 및 한계
- 기존 마스크 검사가 미래 정보 누설을 누락할 수 있음을 밝혀내며, 인과성 검증의 한계를 드러냄.
- 두 번의 순방향 패스만으로 정확한 감사가 가능하다는 점에서 실용적 가치가 큼.
- 한계로는 특정 모델 구조에 대한 일반화 가능성, 또는 다른 타입의 누설에 대한 적용 여부는 명시되지 않음.
실용적 활용
이 방법은 대규모 언어 모델의 인과성 검증, 모델 감사, 보안 검증 등에서 활용 가능하며, 특히 모델 신뢰도를 높이는 데 기여할 수 있다.