한 줄 요약
Prime Agent는 장기적 작업을 위한 RLM 기반 오픈소스 에이전트 허브로, ARC-AGI-3 성능을 30%에서 95.5%까지 향상시킨다.
핵심 기여도
- **Continual Harness**를 통해 히스토리, 메모리, 스킬, 프롬프트, 서브에이전트 사양을 트레jectory에 걸쳐 보존.
- **Recursive Language Model (RLM)** 추상화를 기반으로 IPython REPL을 사용한 프로그래밍 컨텍스트 처리와 테스트 시간 계산 지원.
- **ARC-AGI-3 RHAE Best@1** 성능을 30%에서 95.5%로 향상.
- **Factorio** 환경에서 병렬화 작업을 가능하게 하는 전용 서브에이전트 구현.
핵심 아이디어
Prime Agent는 순차적 처리에 제한된 언어 모델의 한계를 극복하기 위해 외부 정보와 계산을 통합하는 새로운 허브 구조를 제시한다. 이는 **L0 (모델 가중치)**, **L1 (활성 컨텍스트)**, **L2 (지속적 REPL 및 재귀 서브에이전트)**, **L3 (디스크 기반 히스토리, 메모리, 스킬)**의 계층적 정보 관리 체계를 통해 가능하다. 모델은 이 구조를 통해 외부 상태를 읽고, 변환하고, 쓸 수 있어 **von Neumann 구조**에 가까운 동작이 가능해진다.
**Recursive Language Model (RLM)** 추상화를 통해 모델은 프로그래밍 컨텍스트 처리와 테스트 시간 계산을 수행할 수 있으며, **Continual Harness**는 프롬프트, 서브에이전트, 스킬, 메모리 등을 트레젝토리 내에서 수정 가능하게 한다. 이는 모델이 테스트 시간 계산과 정보 관리를 통해 전략 집합을 확장할 수 있도록 한다.
기술적 접근법
- **IPython REPL**을 기반으로 한 지속적 실행 환경을 통해 프로그래밍 컨텍스트 처리 및 테스트 시간 계산을 지원.
- **Recursive Subagents**는 직접적인 에이전트 간 통신을 통해 병렬화 작업을 수행.
- **Agents View**를 통해 인간이 지속적 세션을 관찰하고 관리 가능.
- **Continual Harness**는 히스토리, 메모리, 스킬, 프롬프트, 서브에이전트 사양을 트레젝토리에 걸쳐 보존.
- **Resource Accounting**을 통해 실행, 복구, 검증, 자원 관리를 표준화.
- **Factorio**에서 4개 캐릭터 제어 및 장기적 탐색을 지원.
주요 결과
- **ARC-AGI-3 RHAE Best@1** 성능을 30%에서 95.5%로 향상 (베이스라인 대비 +65.5%).
- **nanoGPT**에서 85.5시간 동안 19개의 검증된 레코드 유지.
- **Factorio**에서 병렬화 작업을 통해 기술 발전을 지속적으로 가능하게 함.
- **GPU-kernel generation**, **emulator construction**, **long-context coding** 등에서 기존 허브와 동등 또는 우수한 성능 보임.
의의 및 한계
Prime Agent는 장기적 작업을 위한 표준화된 허브를 제공하며, 모델의 진정한 최대 성능을 측정하는 데 기여한다. 특히, **RLM**과 **Continual Harness**를 통한 정보 및 계산 관리는 모델이 복잡한 작업을 해결하는 데 유리하다. 그러나 현재 모델은 허브 기능을 충분히 활용하지 못하며, **서브에이전트 할당**, **보존 정보 관리**, **재사용 상태 정제** 등에서 여전히 제약이 있다. 향후 모델-허브 공동 학습이 필요하다.
실용적 활용
Prime Agent는 **시스템 구축**, **자율 연구**, **장기적 환경 탐색**, **GPU 커널 생성** 등 다양한 연구 및 산업 분야에서 활용 가능하다. 특히, **Factorio**와 같은 복잡한 시뮬레이션 환경에서 병렬화 작업을 지원하며, **nanoGPT**와 같은 자율 학습 시스템에서도 장기적 실험을 지속적으로 수행할 수 있다.