AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs

Xiaogeng Liu, Peiran Li, Edward Suh, Yevgeniy Vorobeychik, Z. Mao, Somesh Jha, P. McDaniel, Huan Sun, Bo Li, Chaowei Xiao

arXiv:2410.05295 · 2026-07-27 공개 · arXiv · PDF

gpt-4 red-teaming attack-success-rate black-box-attack llm-jailbreaking auto-dan-turbo strategy-self-exploration plug-and-play-framework

Abstract

In this paper, we propose AutoDAN-Turbo, a black-box jailbreak method that can automatically discover as many jailbreak strategies as possible from scratch, without any human intervention or predefined scopes (e.g., specified candidate strategies), and use them for red-teaming. As a result, AutoDAN-Turbo can significantly outperform baseline methods, achieving a 74.3% higher average attack success rate on public benchmarks. Notably, AutoDAN-Turbo achieves an 88.5 attack success rate on GPT-4-1106-turbo. In addition, AutoDAN-Turbo is a unified framework that can incorporate existing human-designed jailbreak strategies in a plug-and-play manner. By integrating human-designed strategies, AutoDAN-Turbo can even achieve a higher attack success rate of 93.4 on GPT-4-1106-turbo.

한국어 요약

한 줄 요약

AutoDAN-Turbo는 인간 개입 없이 자동으로 범죄적 프롬프트 전략을 탐색하고, GPT-4-1106-turbo에서 93.4%의 공격 성공률을 달성한 블랙박스 제이블레이크 프레임워크이다.

핵심 기여도

핵심 아이디어

AutoDAN-Turbo는 **lifelong learning agents**를 활용하여, 제이블레이크 공격을 위한 전략을 **자동으로 탐색·조합·재사용**하는 프레임워크이다. 기존 연구는 인간이 직접 전략을 설계하거나 단일 전략만 사용하는 한계가 있었으나, AutoDAN-Turbo는 **전략 라이브러리**를 구축하고 이를 기반으로 새로운 공격을 생성한다. 이는 **Harmbench 데이터셋**과 같은 실제 위험 시나리오에서도 높은 공격 성공률을 보장한다. 또한, **Gemma-1.1-7B-it**를 사용한 평가 시스템을 통해 공격의 질을 정량적으로 측정하며, **StrongREJECT Score**를 기준으로 기존 방법 대비 92.3% 더 높은 성능을 보인다.

기술적 접근법

주요 결과

의의 및 한계

AutoDAN-Turbo는 제이블레이크 공격 분야에서 **자동화와 전략 다양성**을 동시에 달성한 첫 번째 프레임워크로, LLM의 안전 정렬을 평가하는 데 중요한 도구로 활용될 수 있다. 특히, **인간 개입 없이 전략을 탐색하고 조합**하는 점에서 기존 연구와 차별화된다. 그러나, **악의적 텍스트 생성**이라는 본질적인 문제로 인해, 이 기술이 악용될 가능성도 존재한다. 또한, **전략 라이브러리의 초기 구성**이 공격 성능에 큰 영향을 미치므로, 초기 탐색 단계의 질이 중요하다는 한계점도 존재한다.

실용적 활용

AutoDAN-Turbo는 **LLM의 안전성 테스트**, **레드팀 테스팅**, **보안 연구** 등에서 활용 가능하다. 특히, **GPT-4-1106-turbo**와 같은 고성능 모델의 취약점을 자동으로 탐색할 수 있어, **보안 업계와 연구소**에서 실용적 도구로 채택될 수 있다.