한 줄 요약
Mara Chain은 거부된 후보를 반복적으로 개선함으로써 AI 시스템 최적화 성능을 20.5%까지 향상시키는 새로운 절차를 제시한다.
핵심 기여도
- **Mara Chain**이라는 새로운 절차를 제안하여, 거부된 후보를 반복적으로 개선함으로써 최적화 성능을 향상시킴.
- **Pareto-filtered Top-N 선택**과 **고정된 깊이의 반복 개선**을 결합하여 후보 풀을 제한하고 효율성을 유지함.
- **AppWorld, TerminalBench 2.1, MuSiQue** 데이터셋에서 기존 방법 대비 최대 20.5%의 상대 성능 향상과 65.5%의 rollout 감소를 달성함.
- **GLM-5, DeepSeek-V4-Pro, Qwen3.5-397B-A17B** 모델에서 모두 일관된 성능 개선을 보임.
핵심 아이디어
기존 AI 시스템 최적화는 **propose-evaluate-select** 절차를 사용하여 후보 설정을 생성하고 평가하며, 기준에 부합하는 후보만 선택한다. 그러나 실패한 후보는 종종 이후 최적화에 중요한 정보를 포함하고 있음에도 불구하고 무시된다. 이는 동일한 실패 패턴을 반복하게 만들며, 최적화의 진전을 저해한다.
Mara Chain은 이러한 문제를 해결하기 위해 **거부된 후보를 반복적으로 개선**하는 절차를 도입한다. 각 후보는 실패한 rollout, 잔차 실패, 분석 결과, 변경 내역을 포함한 정보를 보존하고, 이 정보를 바탕으로 다음 후보를 생성한다. 이는 **역사 조건에 기반한 반복 개선**(history-conditioned refinement)으로, 실패 경험을 누적하여 최종적으로 목표를 달성하도록 유도한다.
기술적 접근법
- **Mara Chain 절차**:
- 거부된 후보를 **보존**하고, **Pareto-filtered Top-N 선택**을 통해 후보 풀을 제한함.
- **고정된 깊이**(최대 5단계)의 반복 개선을 수행하며, 개선된 후보가 없으면 해당 체인은 삭제됨.
- **GLM-5, DeepSeek-V4-Pro, Qwen3.5-397B-A17B** 모델에서 실험 수행.
- **Pareto-filtered Top-N** 파라미터는 기본적으로 **N=3**로 설정됨.
- **Pi coding agent**를 사용하여 후보 생성.
주요 결과
- **AppWorld**에서 **GEPA, ACE, SkillOpt-Lite** 대비 **20.5% 상대 성능 향상**과 **65.5% rollout 감소**.
- **TerminalBench 2.1**에서 **AHE 대비 20.2%, Meta-Harness 대비 22.5% pass rate 향상**.
- **MuSiQue**에서 **nDCG@10 0.104, Recall@10 0.131 개선**.
- **Challenge split**에서 **Challenge TGC 76.7 vs 71.9 (+4.8pp), Challenge SGC 59.0 vs 51.8 (+7.2pp)**.
- **Mara Chain 없이 수행할 경우 MuSiQue에서 nDCG@10 0.034, Recall@10 0.039 감소**.
의의 및 한계
Mara Chain은 AI 시스템 최적화에서 실패한 후보를 자원으로 활용함으로써, 기존 방법이 직면하는 **지속적인 실패 장벽**(persistent failure barriers)을 극복한다. 특히, **복잡한 다단계 작업**(예: TerminalBench 2.1의 sanitize-git-repo)에서 반복적인 부분 수정을 누적하여 최종 성공을 유도하는 점에서 학술적·실용적 가치가 높다.
그러나, **Mara Chain은 실패한 후보의 정보를 효과적으로 활용하는 데 의존**하므로, 초기 후보가 전혀 유의미한 정보를 제공하지 못하는 경우 성능 개선이 제한될 수 있다. 또한, **Pareto-filtered Top-N 선택**은 후보 풀을 제한하지만, 일부 유용한 후보가 제외될 가능성도 존재한다.
실용적 활용
Mara Chain은 **프롬프트, 스킬, 허네스, 코드** 등 모델 가중치를 수정하지 않고 AI 시스템을 최적화해야 하는 상황에서 유용하다. 예를 들어, **AppWorld의 스킬 최적화**, **TerminalBench의 에이전트 허네스 최적화**, **MuSiQue의 검색 파이프라인 최적화**와 같은 다양한 도메인에서 적용 가능하다. 특히, **제한된 rollout 예산**이 있는 환경에서 성능 향상을 추구하는 연구 및 산업 현장에 적합하다.