한 줄 요약
Agent Security Bench(ASB)는 LLM 기반 에이전트의 보안 취약점을 체계적으로 평가하기 위한 벤치마크 프레임워크로, 84.30%의 높은 공격 성공률을 기록하며 방어 기법의 한계를 드러낸다.
핵심 기여도
- ASB는 10개의 시나리오, 10개의 에이전트, 400개 이상의 툴, 27가지 공격/방어 방법, 7개의 평가 지표를 포함한 체계적인 보안 평가 프레임워크이다.
- 새로운 Plan-of-Thought(Plan-of-Thought, PoT) 백도어 공격을 제안하며, 시스템 프롬프트에 숨은 지시를 삽입하여 높은 공격 성공률을 달성한다.
- 13개의 LLM 백본에서 10개의 프롬프트 주입 공격, 1개의 메모리 중독 공격, 4개의 혼합 공격, 11개의 방어 기법을 벤치마킹하여 평균 최대 84.30%의 공격 성공률을 보인다.
- Net Resilient Performance(NRP) 지표를 도입하여 에이전트의 유틸리티와 보안의 균형을 평가한다.
핵심 아이디어
LLM 기반 에이전트는 시스템 프롬프트, 유저 프롬프트 처리, 툴 사용, 메모리 검색 등 여러 단계에서 다양한 공격에 취약할 수 있다. 기존 연구는 주로 성능과 일반화에 집중했으나, 보안성은 충분히 평가되지 않았다. ASB는 이러한 문제를 해결하기 위해 공격과 방어를 체계적으로 범주화하고, 각 단계별 취약점을 평가하는 프레임워크를 제시한다. 특히, 시스템 프롬프트를 타겟으로 하는 Plan-of-Thought(Plan-of-Thought, PoT) 백도어 공격은 기존 공격 방식과 달리 에이전트의 계획 과정을 악용하여 높은 공격 성공률을 보인다. 이는 에이전트의 내부 작동 메커니즘을 깊이 이해해야 가능하며, 기존 방어 기법이 이를 효과적으로 막지 못함을 보여준다.
기술적 접근법
- **ASB 구성 요소**: 10개의 시나리오(e-commerce, autonomous driving, finance 등), 10개의 에이전트, 400개 이상의 툴, 27가지 공격/방어 방법, 7개의 평가 지표 포함.
- **공격 유형**: Direct Prompt Injection(DPI), Indirect Prompt Injection(IPI), Memory Poisoning, Plan-of-Thought(PoT) 백도어 공격, Mixed Attacks.
- **방어 기법**: 11가지 방어 전략 평가.
- **LLM 백본**: 13개의 LLM 모델에서 실험 수행.
- **평가 지표**: 정확도, 공격 성공률, Net Resilient Performance(NRP) 등 7가지 지표 사용.
주요 결과
- **공격 성공률**: 평균 최대 84.30%의 공격 성공률을 기록.
- **방어 효과**: 기존 방어 기법의 효과는 제한적임.
- **공격 유형별 성과**: Plan-of-Thought 백도어 공격은 시스템 프롬프트를 악용하여 높은 성공률을 보임.
- **NRP 지표**: 에이전트의 유틸리티와 보안의 균형을 평가하는 새로운 지표 도입.
의의 및 한계
ASB는 LLM 기반 에이전트의 보안성을 체계적으로 평가하는 첫 번째 벤치마크로, 다양한 공격과 방어 기법을 포괄적으로 다루는 점에서 학술적·실용적 가치가 있다. 특히, Plan-of-Thought 백도어 공격은 기존 연구에서 다루지 않았던 새로운 공격 벡터를 제시하며, 에이전트의 내부 작동 메커니즘을 깊이 이해해야 적용할 수 있는 고급 공격 방식이다. 그러나 ASB는 특정 시나리오와 툴 집합에 제한되며, 실제 산업 환경에서의 보안 위협을 완전히 반영하지 못할 수 있다는 한계가 있다.
실용적 활용
ASB는 금융, 의료, 자율주행 등 안전-critical 도메인에서 LLM 기반 에이전트의 보안성을 평가하는 데 활용될 수 있다. 또한, 방어 기법 개발 및 LLM 백본 선택 시 NRP 지표를 기반으로 성능과 보안의 균형을 고려할 수 있다.