한 줄 요약
MerchantBench는 365일간 지속적인 온라인 판매 시뮬레이션을 통해 LLM 에이전트의 장기 일관성(Long-Term Coherence)을 평가하는 벤치마크이다.
핵심 기여도
- 98,843개 실제 온라인 상품 기록을 기반으로 구성된 365일 주문 수준 시뮬레이션 환경 제시.
- 상품 조달, 가격 설정, 현금 흐름 관리, 지연 피드백 적응 등 4개 상호 의존적 의사결정 구성요소를 포함.
- 8개 LLM과 2개 에이전트 프레임워크(ReAct, Hermes)를 48회 실행하여 장기적 성과 분석.
- 최고 성능 LLM 설정이 인간 참가자 평균 최종 순자산의 27.3%에 불과함을 밝혀 LLM과 인간 간 성능 격차를 드러냄.
핵심 아이디어
기존 LLM 평가가 단기적이고 명확한 성공 기준을 가진 작업에 집중하는 반면, 실제 온라인 판매는 장기적 일관성을 요구한다. 이에 따라, 연구팀은 온라인 판매 환경을 기반으로 **Long-Term Coherence**를 평가하는 새로운 벤치마크인 **MerchantBench**를 제안했다. 이 시뮬레이션은 상품 주문 수준에서의 **Upstream Supplier Events**와 **Downstream Order Outcomes**의 비동기적 피드백 구조를 반영하며, 에이전트가 이전 결정을 재검토하고 전략을 조정하도록 요구한다. 특히, **Product Sourcing**, **Pricing Control**, **Cash-Flow Management**, **Mixed-Latency Feedback Adaptation**이라는 4가지 상호 연관된 의사결정 과정을 통해 장기적 정책 유지와 수정 능력을 평가한다.
기술적 접근법
- **MerchantBench**는 365일 주문 수준 시뮬레이션 환경으로, 98,843개 실제 온라인 상품 기록을 기반으로 구성.
- **26개의 에이전트 상호작용 도구**를 제공하며, **Upstream Supplier Events**는 즉시 관찰 가능, **Downstream Order Outcomes**는 지연되어 나타남.
- **Hermes**와 **ReAct** 두 프레임워크를 사용하여 8개 LLM을 평가.
- **Hermes**는 평균 최종 순자산, GMV, 주문 수 모두에서 **ReAct** 대비 53.3%, 71.5%, 71.2% 높은 성과를 보임.
- **Sustained Window Rate (SWR)**는 30일 기간 내 최소 1회 환경 도구 호출을 기준으로 평가하며, 장기적 활동성을 측정.
주요 결과
- **최고 성능 LLM 설정**이 인간 참가자 평균 최종 순자산의 **27.3%**에 불과함.
- **Hermes** 프레임워크는 8개 모델 중 7개에서 **ReAct** 대비 최종 순자산이 **11.5%~187.8%** 증가.
- **Kimi K2.6**은 Hermes 하에서 **4.1%** 낮은 성과를 보이며, 프레임워크 효과가 모델에 따라 달라짐을 드러냄.
- **Order Anomaly Rate**는 주문 취소, 재고 부족, 배송 지연 등 비정상 주문 비율을 측정하며, LLM의 운영 일관성과 연관됨.
의의 및 한계
- **MerchantBench**는 LLM이 단기적 작업 외에도 장기적 정책 유지와 적응 능력을 평가할 수 있는 첫 번째 벤치마크로, 학술적·실용적 가치가 높음.
- 그러나 **LLM과 인간 간 성능 격차가 여전히 크며**, 특히 **전략 변경이 축적된 증거에 기반하지 않는 경우** 성과가 저하됨.
- **한계점**으로는 시뮬레이션 환경이 실제 온라인 판매와 완전히 동일하지 않으며, 일부 상황에서 인간의 직관이 LLM을 능가함.
실용적 활용
- 온라인 판매 플랫폼, 자동화된 상품 관리 시스템, AI 기반 쇼핑몰 운영 솔루션 등에 적용 가능.
- 특히, **현금 흐름 관리**, **가격 전략 최적화**, **장기적 상품 포트폴리오 관리**에 있어 LLM의 장기적 일관성 평가에 활용할 수 있음.