한 줄 요약
STRACE는 실행 추적의 잡음을 줄이고 근본 원인을 추출하여 에이전트 최적화 성능을 1.4배 향상시키는 구조적 분석 프레임워크이다.
핵심 기여도
- STRACE 프레임워크를 제안하여, 실행 추적을 단순 텍스트가 아닌 **의존성 그래프**로 모델링함.
- **Failure Pattern Mining**과 **Causal Localization**을 결합하여, **42.5% → 58.5%** (16.0% 절대 개선)의 성공률 향상 달성.
- **VeruSAGE-Bench**에서 기존 기준 대비 1.4배 성능 향상.
- **Trace Filtering**을 통해 불필요한 추적을 제거하고, **Root-cause Module**을 정확히 식별함.
핵심 아이디어
기존 에이전트 최적화는 실행 추적을 전체 텍스트로 사용하지만, 이는 불필요한 정보와 잡음을 포함하여 최적화 효율을 저하시킨다. STRACE는 이 문제를 해결하기 위해 실행 추적을 **의존성 그래프**로 모델링하고, **Causal Localization**을 통해 실제 근본 원인을 식별한다. 예를 들어, 단계 50에서 발생한 코드 인터프리터 오류는 단계 5에서 발생한 잘못된 매개변수로 인한 결과일 수 있으나, 기존 방법은 이 관계를 파악하지 못한다. STRACE는 **의존성 그래프**를 기반으로 **비인과적 단계를 제거**하고, **근본 원인 모듈**을 정확히 추출하여 최적화를 집중적으로 수행한다.
기술적 접근법
- **Structural Modeling**: 실행 추적을 **의존성 그래프**로 변환하여 데이터 및 제어 흐름을 기록함.
- **Failure Pattern Mining and Trace Filtering**: 추적 집합에서 **재발 빈도**와 **심각도**를 기준으로 **중복 또는 낮은 가치의 실패**를 필터링함.
- **Causal Localization**: 의존성 그래프를 역추적하여 **비인과적 단계를 제거**하고, **근본 원인 모듈**을 식별함.
- **Inductive Policy Optimization**: 추출된 근본 원인을 기반으로 **자연어 히스토리**를 생성하여 해당 모듈의 **정책을 업데이트**함.
- **Hyperparameter**: 추적 필터링 시 **재발 빈도**와 **심각도**를 기준으로 설정됨.
주요 결과
- **VeruSAGE-Bench**에서 **42.5% → 58.5%** (16.0% 절대 개선)의 성공률 향상.
- **HotpotQA**, **WebArena**에서도 기존 기준 대비 일관된 성능 향상.
- **Trace Filtering** 제거 시 성능과 효율성이 악화됨 (실험 결과 참조).
- **Causal Localization** 없이 전체 추적 또는 현재 노드만 사용할 경우, **성능 저하 및 불필요한 비용 증가** 발생.
의의 및 한계
STRACE는 실행 추적의 잡음을 줄이고, 근본 원인을 정확히 식별함으로써 에이전트 최적화의 **정확성과 효율성**을 동시에 향상시킨다. 특히, **의존성 그래프 기반 분석**은 기존 텍스트 기반 방법의 한계를 극복하며, **정책 최적화의 안정성**을 높인다. 그러나, 의존성 그래프 생성 과정에서 **추적 데이터의 질**에 따라 성능이 영향을 받을 수 있으며, **복잡한 시스템에서는 의존성 추론이 어려울 수 있음**이 한계로 제시된다.
실용적 활용
STRACE는 **복잡한 장기적 에이전트 시스템**(예: 자율 소프트웨어 엔지니어링, 코드 인터프리터)의 최적화에 적용 가능하다. 특히, **툴 사용 정책**, **스킬 모듈**, **편집 가능한 하이퍼파라미터** 등에 국한된 최적화가 가능하며, **코드 수정 없이 안정적인 성능 향상**을 도모할 수 있다.