한 줄 요약
RSIAgent는 새로운 환경에서 모델 파라미터 업데이트 없이 자율적으로 메모리를 구축하고 재사용하는 다중 에이전트 프레임워크이다.
핵심 기여도
- RSIAgent는 **BRS**(Broad Recursive Self-exploration)와 **DRS**(Deep Recursive Self-exploration)를 결합한 **broad-then-deep 탐색 전략**을 제안한다.
- **Kimi-K3**와 **GLM-5.3** 모델에서 **GPT-6**를 포함한 폐쇄형 모델을 초과하는 성능을 달성한다.
- **OSWorld-v2**와 **Agent’s Last Exam** 데이터셋에서 **74.54% 평균 점수**를 기록하며, **BRS + DRS**가 단일 단계보다 10% 이상 성능을 개선한다.
- **모델 파라미터 업데이트 없이** 환경별 지식을 자율적으로 학습하고 재사용하는 **training-free** 프레임워크를 제시한다.
핵심 아이디어
기존 디지털 에이전트는 새로운 환경에 적응하기 위해 추가 학습 데이터를 수집하거나 인간의 도움을 필요로 하지만, RSIAgent는 **모델 파라미터를 업데이트하지 않고도 자율적으로 메모리를 구축**하여 이를 재사용하는 방식을 제안한다. 이는 인간이 새로운 소프트웨어를 배우는 방식—탐색, 경험, 인과 관계 추출—을 모방한 것이다.
RSIAgent는 **3가지 역할의 에이전트**(curriculum, actor, verifier)를 조율하여 **자체적으로 탐색하고, 결과를 검증하며, 인과 관계를 메모리에 저장**한다. 특히, **BRS**는 다양한 환경 구조를 병렬적으로 탐색하여 전체적인 이해를 구축하고, **DRS**는 어려운 사례와 숨겨진 제약 조건을 집중적으로 탐색하여 세부적인 인과 관계를 발견한다. 이는 **coarse-to-fine 방식**으로, 전체적인 지식을 확보한 후 세부 사항을 정제하는 과정이다.
기술적 접근법
- **Multi-agent Framework**: curriculum, actor, verifier 3가지 에이전트가 협력하여 탐색, 실행, 검증을 반복한다.
- **BRS (Broad Recursive Self-exploration)**: 다양한 환경 구조를 병렬적으로 탐색하여 전체적인 이해를 구축.
- **DRS (Deep Recursive Self-exploration)**: 어려운 사례, 숨겨진 제약 조건, 경계 조건을 집중적으로 탐색.
- **Memory Reuse**: 학습된 메모리는 **frozen 상태**로 유지되어, 이후 태스크에서 **모델 파라미터 업데이트 없이 재사용** 가능.
- **하이퍼파라미터**: 탐색 예산, 반복 횟수, 태스크 선택 기준은 실험별로 조정되며, 상세한 설정은 Appendix에 기술됨.
주요 결과
- **OSWorld-v2**와 **Agent’s Last Exam**에서 **Kimi-K3**와 **GLM-5.3** 모델이 **GPT-6**를 포함한 폐쇄형 모델을 초과.
- **BRS + DRS** 조합은 4개의 OSWorld 2.0 태스크에서 **74.54% 평균 점수**를 달성.
- **BRS 단독**은 65.52%, **DRS 단독**은 56.50%로, **Full RSI**가 단일 단계보다 10% 이상 성능 개선.
- **T085**와 **T089** 태스크에서 **DRS 단독**은 기준선보다 낮은 성능을 보임.
- **GameCraft-Bench**에서 **RSIAgent**는 **Play2Code** 대비 **약한 및 강력한 기반 게임 모두에서 일관된 개선**을 보임.
의의 및 한계
RSIAgent는 **모델 파라미터 업데이트 없이도 환경별 지식을 자율적으로 학습하고 재사용**할 수 있는 **training-free** 프레임워크로, 기존 학습 기반 접근법의 비용과 제약을 극복한다. 특히, **인과 관계를 추출하고 재사용하는 메커니즘**은 디지털 에이전트의 **자체적 개선 능력**을 강화하며, **오픈소스 모델이 폐쇄형 모델을 초과하는 가능성을 열어준다**.
그러나, **초기 탐색 단계에서의 오류 누적**이나 **복잡한 환경에서의 메모리 관리 효율성**은 아직 명시되지 않았으며, **장기적 탐색과 적응 능력**에 대한 추가 연구가 필요하다. 또한, **복잡한 게임 환경에서의 확장성**도 향후 연구 주제로 제시된다.
실용적 활용
RSIAgent는 **OSWorld와 같은 디지털 환경**, **게임 개발**, **AI for Science** 등에서 **자율적 탐색과 지식 재사용이 필요한 시스템**에 적용 가능하다. 특히, **사용자 인터페이스가 자주 변화하는 환경**이나 **인간의 개입 없이도 지속적으로 개선해야 하는 시스템**에서 유용하다.