한 줄 요약
MUSE는 언어 모델에서 데이터 제거 효과를 6가지 기준으로 평가하는 벤치마크로, 기존 알고리즘의 한계를 드러냄.
핵심 기여도
- MUSE: 언어 모델 언러닝 평가를 위한 6가지 기준(verbatim, knowledge, privacy, utility, scalability, sustainability)을 제시.
- 7B 파라미터 언어 모델에서 8가지 언러닝 알고리즘을 해리포터 책과 뉴스 기사 데이터로 평가.
- 기존 알고리즘은 대부분 verbatim과 knowledge 제거는 어느 정도 성공하지만, privacy leakage를 방지하지 못함.
- NPO와 Task Vectors는 제거 효과가 높으나, 모델 유틸리티를 크게 저하시키고 대규모 제거 요청에는 실패함.
핵심 아이디어
기존 언러닝 평가가 데이터 소유자와 모델 운영자의 요구를 모두 반영하지 못한 문제를 해결하기 위해 MUSE를 제안함. MUSE는 언러닝 모델이 (1) 정확한 토큰 재현(verbatim), (2) 지식 재현(knowledge), (3) 개인정보 유출(privacy), (4) 비제거 데이터 유틸리티 유지(utility), (5) 대규모 제거 요청 대응(scalability), (6) 연속 제거 요청 대응(sustainability)의 6가지 기준을 평가함. 이는 기존 연구에서 주로 사용된 단일 태스크 성능 평가와 달리, 실용적 관점에서의 종합적 평가를 가능하게 함. 예를 들어, privacy leakage는 membership inference attack(AUC-ROC)을 통해 측정하며, 유틸리티는 비제거 데이터셋에서의 성능 유지 여부로 평가함.
기술적 접근법
- **모델**: 7B 파라미터 언어 모델 사용.
- **데이터**: 해리포터 책과 뉴스 기사로 구성된 두 데이터셋.
- **평가 지표**:
- VerbatimMem: ROUGE-L F1 점수로 측정.
- KnowMem: 질문-답변 쌍에 대한 ROUGE 점수 평균.
- PrivLeak: Min-K% Prob 기반 AUC-ROC 점수로 측정.
- **언러닝 알고리즘**: Negative Preference Optimization(NPO), Task Vectors 등 8가지 알고리즘 평가.
- **비교 대상**: retraining(정확한 언러닝)을 기준으로 비교.
주요 결과
- **Harry Potter 데이터셋**: 대부분의 알고리즘은 verbatim memorization(VerbMem)과 knowledge memorization(KnowMem)을 어느 정도 제거했으나, privacy leakage(AUC-ROC)는 대부분 0.5 이상으로, 정보 유출 위험 있음.
- **NPO**: KnowMem 0.12 (retraining 대비 +0.08), PrivLeak 0.68 (retraining 대비 +0.18).
- **Task Vectors**: KnowMem 0.11 (retraining 대비 +0.07), PrivLeak 0.71 (retraining 대비 +0.21).
- **유틸리티**: NPO와 Task Vectors는 비제거 데이터셋에서 성능이 10% 이상 저하됨.
- **대규모 제거 요청**: 100개 이상의 데이터 제거 시, 대부분의 알고리즘은 성능 저하 또는 실패됨.
의의 및 한계
MUSE는 언러닝 알고리즘의 실용성과 효과성을 종합적으로 평가할 수 있는 체계적인 프레임워크를 제공함. 특히, privacy leakage와 유틸리티 유지라는 모순적 요구를 동시에 평가함으로써, 기존 연구에서 간과된 문제를 드러냄. 그러나 MUSE는 7B 모델에만 적용되었으며, 다른 크기의 모델이나 비언어 데이터(이미지, 음성)에 대한 확장은 아직 이루어지지 않았음. 또한, 일부 알고리즘은 대규모 제거 요청에 대응하지 못하는 한계가 있음.
실용적 활용
MUSE는 언어 모델에서 개인 정보 또는 저작권 데이터를 제거해야 하는 의료, 법률, 미디어 산업에서 유용하게 활용될 수 있음. 예를 들어, 환자의 진료 기록을 제거한 의료 진단 모델의 개인정보 유출 여부를 정량적으로 평가할 수 있음. 또한, 언론사가 특정 기사 데이터를 제거한 언어 모델의 유틸리티 유지 여부를 확인하는 데 활용 가능함.