한 줄 요약
긴 시간 범위의 에이전트 실패 원인을 추적하는 문제를 반복적 탐색 프레임워크로 해결하여 GPT-5.5의 F1 점수를 0.349에서 0.498로 40% 이상 향상시킨다.
핵심 기여도
- **Continual Search**라는 반복적 탐색 프레임워크를 제안하여, 기존의 one-shot LLM 판단 방식의 한계를 극복.
- **MegaRCA-Mix**라는 50개의 인간 주석 실패 사례로 구성된 새로운 대규모 RCA 평가 데이터셋을 제시.
- GPT-5.5의 F1 점수를 MegaRCA-Mix에서 0.349 → 0.498 (40% 이상 향상)로 개선.
- 동일 모델 패밀리 내에서 **하위 모델이 상위 모델을 초과**하는 사례를 보여, 모델 규모보다 탐색 효율이 중요함을 입증.
핵심 아이디어
기존의 RCA 방법은 LLM을 사용하여 실행 추적을 단일 패스로 분석하는 one-shot 판단 방식을 채택한다. 하지만 긴 실행 추적에서 유의미한 정보는 희소하고, 멀리 분산되어 있어 단일 판단으로는 충분히 탐색할 수 없다. 이에 따라, **Root-Cause Attribution은 대규모 탐색 문제**로 재정의되어야 한다는 통찰이 제시된다.
이에 따라, **Continual Search**라는 반복적 탐색 프레임워크가 제안된다. 이는 **LLM judge가 여러 턴을 거치며 새로운 증거를 지속적으로 탐색**하도록 유도하는 방식이다. 각 턴에서 judge는 이전에 탐색하지 못한 증거를 찾아내고, 이를 바탕으로 초기 진단을 수정하거나 확장한다. 이는 단순히 판단을 반복하는 것이 아니라, **증거 공간을 확장하며 탐색을 지속하는 알고리즘적 접근**이다.
기술적 접근법
- **Continual Search**는 **Agent-as-a-Judge** 프레임워크를 기반으로, **Claude Agent SDK**를 사용하여 구현.
- **Tool-enabled judges**는 실행 기록에 포함된 다양한 아티팩트 (로그, 검증 결과, 샌드박스 아티팩트 등)를 선택적으로 탐색.
- **MegaRCA-Mix**는 **Harbor Index**에서 추출한 50개 실패 사례로 구성되며, **286K 토큰**의 중앙값 크기를 가짐.
- 평가 시, **GPT-5.5**와 **Passive Continuation** (단순 재검토)를 비교하며, **F1 점수**를 주요 지표로 사용.
- **TRAIL**, **TELBench**, **AgentRx**, **Who&When**과 같은 기존 RCA 벤치마크에서도 평가됨.
주요 결과
- **MegaRCA-Mix**에서 **GPT-5.5의 F1 점수**는 Continual Search 적용 시 **0.349 → 0.498** (40% 이상 향상).
- **TRAIL**에서 GPT-5.5의 Weighted F1은 **0.426 → 0.500** (4 턴 동안).
- **Passive Continuation** 대비, Continual Search는 **42K → 58K 토큰**의 증거를 추가적으로 탐색.
- **AgentRx** 및 **Who&When**과 같은 짧은 실행 추적에서는 추가 탐색이 효과적이지 않음.
- **하위 모델이 상위 모델을 초과**하는 사례 발생, 예: GPT-4가 GPT-5.5보다 높은 성능 보임.
의의 및 한계
- **Continual Search**는 대규모 실행 추적에서의 RCA 성능을 지속적으로 향상시키는 **반복적 탐색 프레임워크**로, 기존 one-shot 방식의 한계를 극복.
- **MegaRCA-Mix**는 실제 세계의 복잡한 실패 사례를 반영한 **대규모 인간 주석 데이터셋**으로, RCA 연구의 기준을 높임.
- **LLM의 모델 규모보다 탐색 전략이 더 중요하다는 점**을 입증, 모델 개선 전략에 새로운 통찰 제공.
- 한계로는 짧은 실행 추적에서는 효과적이지 않으며, **증거 탐색의 질에 따라 성능이 변동**할 수 있음.
실용적 활용
- **보안 및 안전 분야**에서 자동화된 RCA를 통해 침해 경로를 정확히 재구성하고, 개선 방향을 도출할 수 있음.
- **자체 학습 에이전트 시스템**에서 실패 사례를 기반으로 지속적인 개선을 도출하는 데 활용 가능.
- **복잡한 다 에이전트 시스템**에서 분산된 증거를 통합적으로 분석하는 데 효과적.