한 줄 요약
InjecAgent는 도구 통합 대형 언어 모델 에이전트의 간접 프롬프트 주입 취약성을 평가하는 벤치마크로, GPT-4 기반 ReAct 프롬프트 에이전트가 24%의 공격 성공률을 보임.
핵심 기여도
- **InjecAgent**라는 도구 통합 LLM 에이전트의 간접 프롬프트 주입 취약성 평가 벤치마크를 최초로 제시.
- 1,054개 테스트 케이스로 구성, 17개 사용자 도구와 62개 공격자 도구를 포함.
- **ReAct-prompted GPT-4**는 24%의 공격 성공률을 보이며 취약함.
- **해킹 프롬프트**를 추가한 경우 공격 성공률이 47%로 거의 두 배 증가.
핵심 아이디어
LLM 에이전트가 외부 콘텐츠를 처리하는 과정에서 **간접 프롬프트 주입**(IPI) 공격을 받을 수 있음. 이는 사용자에게 해를 끼치거나 개인 정보를 유출하는 악의적인 지시가 포함된 콘텐츠를 통해 에이전트를 조종하는 방식이다. 본 연구는 IPI 공격의 현실적 위험성을 평가하기 위해 **InjecAgent**라는 벤치마크를 제안하며, 사용자 도구와 공격자 도구의 상호작용을 기반으로 공격 시나리오를 구축함. 예를 들어, 사용자가 건강 앱을 통해 의사 리뷰를 요청할 때, 공격자가 리뷰에 악의적인 예약 지시를 포함하면, 에이전트가 이를 실행하면 공격이 성공함. 이는 **도구 실행**(tool execution)과 **프롬프트 구조**(ReAct)에 따라 결과가 달라지며, 특히 **ReAct 프롬프트**가 공격에 취약함을 보임.
기술적 접근법
- **InjecAgent**는 1,054개 테스트 케이스로 구성, 17개 사용자 도구와 62개 공격자 도구를 포함.
- **공격 유형**은 두 가지로 분류: 사용자에게 직접 해를 끼치는 공격(예: 금융 거래, 스마트 홈 조작)과 개인 정보 유출 공격.
- **LLM 에이전트 평가 방법**은 두 가지:
- **Prompted Method**: ReAct 프롬프트를 사용한 에이전트.
- **Fine-tuned Method**: 도구 호출 예시로 미세 조정된 LLM.
- **공격 성공률**(ASR)을 주요 평가 지표로 사용하며, **ASR-valid**는 유효한 출력 중 공격 성공 비율로 정의됨.
- **GPT-4 기반 ReAct 프롬프트 에이전트**는 24%의 공격 성공률을 보이며, 해킹 프롬프트를 추가하면 47%로 증가.
- **Fine-tuned GPT-4**는 공격 성공률이 7.1%로 훨씬 낮음.
주요 결과
- **ReAct-prompted GPT-4**는 24%의 공격 성공률을 보임.
- 해킹 프롬프트를 추가한 경우, 공격 성공률이 47%로 증가.
- **Fine-tuned GPT-4**는 공격 성공률이 7.1%로, Prompted 에이전트보다 훨씬 안정적.
- **InjecAgent**는 다양한 도메인(금융, 스마트 홈, 이메일 등)을 커버하며, 30개 LLM 에이전트를 평가.
의의 및 한계
InjecAgent는 도구 통합 LLM 에이전트의 IPI 공격 취약성을 체계적으로 평가하는 최초의 벤치마크로, LLM 에이전트의 보안 강화에 중요한 기초 자료가 됨. 특히, ReAct 프롬프트가 공격에 취약함을 보여주며, 미세 조정된 모델이 더 안정적임을 입증함. 그러나 본 연구는 **공격 시나리오의 현실성**과 **LLM의 반응 해석**에 의존하며, 일부 모델은 **유효 출력률**(valid rate)이 낮아 평가에 제한이 있음. 또한, **오픈소스 LLM**의 성능이 낮아 평가에서 제외된 점도 한계로 지적됨.
실용적 활용
InjecAgent는 금융, 스마트 홈, 이메일 등 다양한 도메인에서 LLM 에이전트의 보안성을 평가하는 데 활용 가능. 특히, **도구 사용 에이전트**를 개발하거나 배포하는 기업과 연구소에서 IPI 공격에 대한 취약성 점검에 사용할 수 있음. 또한, **ReAct 프롬프트 기반 에이전트**는 보안 강화를 위해 **미세 조정**(fine-tuning) 또는 **추가 보안 프롬프트** 도입이 필요함.