한 줄 요약
OpenART는 복잡하고 진화하는 환경에서 에이전트 안전성을 평가하기 위한 대규모 레드팀 테스트 플랫폼으로, 환경 진화를 통해 85.0%의 공격 성공률을 달성한다.
핵심 기여도
- OpenART는 50개 도메인에 걸쳐 10,000개 이상의 검증된 상태 기반 시나리오를 제공하며, 500,000개 이상의 도구와 기술을 활용한다.
- Evolutionary Markov Hypergraph Attack (EMHA)는 매개변수 업데이트 없이 환경 진화를 수행하는 블랙박스 정책으로, 75개 에이전트-모델 구성에서 85.0%의 공격 성공률(ASR)을 달성한다.
- 환경 진화의 효과는 시나리오 복잡도가 높아질수록 증가하며, 가장 복잡한 환경에서는 17.2–17.6%의 ASR 개선을 보인다.
- 에이전트 런타임 구현이 안전성에 7.6%의 추가 변동을 유발함을 밝혀, 모델 중심 평가의 한계를 드러낸다.
핵심 아이디어
기존 에이전트 안전성 평가가 단기적이고 정적 환경에 국한되며, 복잡한 상태 변화를 반영하지 못한다는 문제를 해결하기 위해 OpenART는 **실행 가능한 환경**을 레드팀 테스트의 핵심 단위로 설정한다. 이는 단일 프롬프트나 작업이 아닌, **지속적으로 진화하는 환경**을 기반으로 안전성을 평가하는 새로운 접근법이다.
OpenART는 **SkillNet**에서 수집한 500,000개 이상의 도구, MCP, 기술을 기반으로 **의존성 그래프**를 합성하여 시나리오를 생성하고, **99.3%의 정확도**를 달성하는 자동화된 행동 탐지기를 통해 검증한다. 이 시나리오는 15개 배포된 에이전트와 5개 기초 모델을 결합해 75개의 에이전트-모델 구성으로 테스트된다.
EMHA는 **블랙박스 정책**으로, 환경 진화를 **하이퍼그래프 경로 탐색**으로 모델링하며, 매개변수 업데이트 없이 **피드백 기반 상태 전이**를 반복적으로 수행한다. 이는 에이전트의 단기적 행동이 아닌, **장기적 상호작용 궤적**을 통해 안전 실패를 평가하는 핵심 아이디어이다.
기술적 접근법
- **OpenART**는 500,000개 이상의 도구와 기술을 기반으로 50개 도메인에 걸쳐 10,000개 이상의 검증된 시나리오를 생성하며, 각 시나리오당 평균 97개의 도구 호출이 필요하다.
- **EMHA**는 **하이퍼그래프**를 사용한 환경 진화 정책으로, **블랙박스** 방식이며 매개변수 업데이트 없이 **피드백 기반 상태 전이**를 수행한다.
- **타겟-에이전트 비특정적** 시나리오 표현과 **라이트급 런타임 어댑터**를 통해 15개 에이전트와 5개 기초 모델 간의 비교 가능성을 보장한다.
- **공격 벡터**로는 워크스페이스, 인스트럭션, 기술, 도구, MCP, 단기 기억, 계획 상태, 장기 기억 등 8개가 사용되며, 각 에이전트의 지원 범위에 따라 노출된다.
- **Evaluator feedback**을 통해 환경 상태를 점진적으로 변화시키며, **공격 성공률(ASR)**을 측정한다.
주요 결과
- EMHA는 75개 에이전트-모델 구성에서 **85.0%의 공격 성공률(ASR)**을 달성한다.
- 가장 복잡한 환경에서는 **17.2–17.6%의 ASR 개선**을 보이며, 환경 진화의 효과가 시나리오 복잡도와 함께 증가함을 보여준다.
- **타겟 에이전트의 런타임 구현**이 ASR 변동에 **7.6% 추가 기여**하며, 모델 중심 평가의 한계를 드러낸다.
- **워크스페이스 진화**는 92.5%의 ASR를 달성하며, 단일 공격 벡터보다 2.2% 높은 성능을 보인다.
- **EMHA 전체**는 94.7%의 ASR를 달성하며, **인스트럭션만 사용한 진화** 대비 13.1% 높은 성능을 보인다.
의의 및 한계
OpenART는 기존 에이전트 안전성 평가의 단기적, 정적 한계를 극복하고, **지속적 상태 변화**를 반영한 **장기적 상호작용 궤적**을 평가하는 기반을 제공한다. 특히, **EMHA**는 매개변수 업데이트 없이도 높은 공격 성공률을 달성하며, **블랙박스 정책**의 유연성을 입증한다.
그러나 OpenART는 **특정 도구와 기술 집합**에 의존하며, **모든 에이전트와 환경**을 포괄하지는 않는다. 또한, **공격 벡터의 선택**은 에이전트의 지원 범위에 따라 달라지므로, **일관된 비교**를 위해서는 추가 연구가 필요하다.
실용적 활용
OpenART는 **AI 에이전트의 장기적 안전성**을 평