한 줄 요약
LLM 기반 다중 에이전트 시스템에서 통신 메시지를 조작하는 새로운 공격 방식인 Agent-in-the-Middle(AiTM)를 제안하고, 다양한 환경에서 40% 이상의 공격 성공률을 보인다.
핵심 기여도
- **AiTM 공격 방식 제안**: 기존 에이전트 자체를 해킹하는 방식과 달리, 에이전트 간 통신 메시지를 조작하여 전체 시스템을 탈취하는 새로운 공격 모델을 제시.
- **LLM 기반 적대 에이전트 설계**: 제한된 통제 환경과 역할 기반 통신 구조를 고려한 반사 메커니즘(reflection mechanism)을 갖춘 적대 에이전트를 설계.
- **실험적 검증**: AutoGen, Camel 등 다양한 다중 에이전트 프레임워크와 MMLU, HumanEval, MBPP 데이터셋에서 평균 40% 이상, 최대 70% 이상의 공격 성공률(ASR)을 기록.
- **실제 시스템 적용**: MetaGPT, ChatDev 등 실제 LLM-MAS 애플리케이션에서도 공격 가능성을 입증.
핵심 아이디어
기존 연구는 주로 개별 에이전트의 취약점을 타겟팅하는 방식에 집중했으나, 본 연구는 **에이전트 간 통신 메커니즘 자체를 공격 표면으로 삼는 새로운 접근법**을 제시한다. AiTM은 **에이전트의 역할과 통신 형식에 제약을 받으면서도, 특정 피해 에이전트의 메시지를 조작함으로써 시스템 전체의 행동을 유도**하는 방식이다.
핵심 아이디어는 **외부 LLM 기반 적대 에이전트가 피해 에이전트의 메시지를 가로채고, 반사 메커니즘을 통해 문맥에 맞는 악의적인 지시를 생성**하는 점이다. 예를 들어, 토론 중인 에이전트가 특정 결론으로 이끄는 방향으로 메시지를 조작함으로써, 전체 시스템의 출력을 조정할 수 있다. 이는 **에이전트의 프로파일이나 능력은 변경하지 않으면서도, 통신을 통해 간접적으로 시스템을 조작**하는 혁신적인 공격 방식이다.
기술적 접근법
- **공격 아키텍처**: AiTM은 **외부 적대 에이전트**가 **피해 에이전트의 메시지를 가로채고 조작**하는 구조를 채택.
- **적대 에이전트 기술**: GPT-4o 기반의 **LLM-powered 적대 에이전트**가 **반사 메커니즘(reflection mechanism)**을 통해 **문맥에 맞는 악의적인 지시를 생성**.
- **공격 목표**:
- **Targeted behavior**: MMLU에서는 Unicode 코드를 조작(예: A → E), HumanEval/MBPP에서는 `safety_check` 함수 삽입을 유도.
- **DoS (Denial of Service)**: 시스템이 "I can not assist the request"와 유사한 응답을 하도록 유도.
- **실험 환경**: AutoGen, Camel 프레임워크와 Chain, Tree, Complete, Random 통신 구조에서 평가.
- **데이터셋**: MMLU(생물학, 물리학), HumanEval, MBPP 사용.
- **피해 에이전트 위치**: Chain 구조에서는 A₂, Tree 구조에서는 C₁, Complete 및 Random 구조에서는 첫 번째 에이전트를 공격 대상으로 설정.
주요 결과
- **공격 성공률(ASR)**:
- MMLU(생물학, 물리학): 평균 40% 이상, 일부 경우 70% 이상.
- HumanEval: 42.3% (베이스라인 대비 +18.2%).
- MBPP: 45.6% (베이스라인 대비 +21.4%).
- **DoS 공격 성공률**: 평균 38.7%, 일부 시스템에서는 65% 이상.
- **프레임워크별 성능**: AutoGen과 Camel 모두에서 유사한 성공률을 기록.
- **실제 애플리케이션 적용**: MetaGPT, ChatDev 등 실제 LLM-MAS 애플리케이션에서도 공격 가능성을 입증.
의의 및 한계
AiTM은 **LLM-MAS의 핵심 통신 메커니즘에 대한 새로운 공격 표면을 드러내며, 기존 보안 연구가 통신 측면을 간과하고 있음을 지적**한다. 특히, **에이전트 자체가 아닌 통신을 타겟팅하는 방식은 기존 방어 전략을 무력화할 수 있는 잠재적 위험**을 제시한다.
그러나 AiTM은 **에이전트의 역할과 통신 형식에 제약을 받는다는 한계**가 있다. 예를 들어, 요구 분석만 담당하는 에이전트는 코드 삽입과 같은 공격을 수행할 수 없다. 또한, **공격 성공률이 100%에 도달하지 못하며, 일부 시스템에서는 낮은 성능을 보이는 경우도 있음**. 이는 공격 조건에 따라 효과가 달라질 수 있음을 시사한다.
실용적 활용
AiTM은 **소프트웨어 개발, 과학 연구, 고객 서비스 등 LLM-MAS가 활용되는 분야에서 보안 위협을 식별하고 방어 전략을 설계하는 데 유용**할 수 있다. 특히, **분산 시스템이나 네트워크 기반 통신이 필요한 환경에서 통신 보안 강화가 절실**하다. 본 연구는 **LLM-MAS의 보안 설계 및 통신 프로토콜 개선에 중요한 참고 자료**가 될 수 있다.