한 줄 요약
PAST-Bench는 개인 에이전트의 경험 기반 자기 개선 능력을 평가하고 Hermes+를 통해 개선 경로를 진단하는 벤치마크와 개선 프레임워크를 제시한다.
핵심 기여도
- PAST-Bench: 26개 시나리오, 204개 에피소드로 구성된 경험 기반 자기 진화 평가 벤치마크.
- Hermes+: Hermes 기반 5개 개입을 도입한 개선 프레임워크로, Update 태스크에서 가장 뚜렷한 개선 효과 보임.
- 평가 지표: "Δ" (0.13 → 0.15), "Mech" (0.64 → 0.73)로 개선 경로의 명확도 증가.
- 경험 기반 개선 효과는 모델과 능력에 따라 불균형하게 나타남.
핵심 아이디어
PAST-Bench는 개인 에이전트가 과거 경험을 저장하고 재사용하여 미래 행동을 개선하는 능력을 평가하기 위한 벤치마크이다. 기존 평가 방식은 단일 태스크 기반의 점수만 제공했으나, PAST-Bench는 "경험 저장 → 검색 → 적용 → 갱신"이라는 경로를 추적하며, 이 경로가 실제 성능 향상에 기여하는지 분석한다. 이는 "performance-attribution" 문제를 해결하기 위한 핵심 접근이다.
Hermes+는 Hermes 프레임워크에 5개의 개입을 추가한 버전으로, 경험 저장, 검색, 적용, 갱신 단계에서의 문제점을 진단하고 개선한다. 특히, "update" 태스크에서 이전 상태를 갱신해야 하는 상황에서 가장 효과적임을 보여준다.
기술적 접근법
- **PAST-Bench 구성**: 4가지 능력(메모리, 절차 재사용, 정보 수집, 갱신)에 걸쳐 26개 시나리오, 204개 에피소드로 구성.
- **실험 조건**: 동일한 모델과 태스크 패밀리에서 "경험 저장 on/off" 조건을 비교.
- **프레임워크**: Hermes, OpenClaw, Mem0, LangGraph 등 4개 에이전트 프레임워크 사용.
- **모델**: 7개 기반 모델로 실험.
- **평가 지표**: "Δ" (성능 향상 평균), "Mech" (경로 증거 점수) 사용.
- **Hermes+ 개입**: 에이전트 루프의 5단계에 개입하여 경험 경로를 명확히 만듦.
주요 결과
- **성능 향상**: MiniMax-M2.7 기반 Hermes+에서 "Δ"는 +0.13 → +0.15, "Mech"는 0.64 → 0.73 증가.
- **Update 태스크**: 가장 뚜렷한 개선 효과 보임.
- **모델/능력 의존성**: 개선 효과는 모델과 능력에 따라 불균형하게 나타남.
- **PAST-Bench 평가**: 26개 시나리오, 204개 에피소드에서 경험 경로의 영향을 분리하여 평가.
의의 및 한계
PAST-Bench는 개인 에이전트의 경험 기반 자기 진화를 체계적으로 평가할 수 있는 기초를 제공하며, Hermes+는 경험 경로의 진단과 개선을 위한 구조적 개입을 제시한다. 이는 강화 학습 없이도 에이전트가 지속적으로 개선되는 방식을 연구하는 데 기여할 수 있다.
하지만, 개선 효과는 모델과 능력에 따라 불균형하게 나타나며, Hermes+는 특정 상황에서만 효과적임을 보여준다. 또한, 경험 저장/갱신 경로의 진단은 모델 종속적일 수 있어, 보편적인 해결책으로 보기에는 한계가 있다.
실용적 활용
PAST-Bench는 개인 에이전트의 지속적 학습 능력을 평가하는 데 활용될 수 있으며, Hermes+는 사용자 맞춤형 AI 서비스(예: 개인 비서, 자동화 도구)에서 경험 기반 행동 개선을 구현하는 데 유용하다. 특히, 정보 갱신이 필요한 상황에서 Hermes+의 개입이 유의미한 성능 향상을 제공할 수 있다.