한 줄 요약
이 연구는 3T(작업 능력, 시간 할당, 신뢰) 원칙을 기반으로 한 프로액티브 LLM 에이전트의 설계, 구현, 평가 기초를 제시하며, Proactivity-Gym이라는 시뮬레이션 평가 테스트베드를 소개한다.
핵심 기여도
- 3T(작업 능력, 시간 할당, 신뢰) 원칙을 제시하여 기존 연구에서 혼동되거나 간과되었던 프로액티브 에이전트 설계 요소를 명확히 구분.
- 5차원 설계 공간(task scope, anticipation horizon, activation trigger, processing timing, intervention depth)을 정식화하고, 사용자 및 환경 모델링, 백본 LLM, 에이전트 허네스 등 구현 요소를 명시.
- Proactivity-Gym이라는 시뮬레이션 기반 평가 테스트베드를 제안, 10개의 멀티데이 시나리오와 3개의 사용자 인격을 포함.
- 23개의 모델-허네스 구성에서 평가를 수행하여, 강력한 모델조차도 시간 할당 및 신뢰 측면에서 큰 한계를 보임을 밝힘.
핵심 아이디어
기존 연구는 사용자 요청에 반응하는 **반응형**(reactive) 에이전트에 집중했으나, 이 연구는 사용자가 요청하기 전에 유용한 작업을 수행하는 **프로액티브**(proactive) 에이전트의 설계 기초를 제시한다. 핵심 아이디어는 3T(3T: Task Capability, Temporal Allocation, Trust) 원칙을 기반으로, 작업 능력, 시간 할당, 신뢰를 **동시에 고려**하여 에이전트의 도움이 사용자에게 **실질적 가치**를 제공하도록 하는 것이다.
예를 들어, 에이전트가 올바르게 작업을 수행하더라도, **적절하지 않은 시점**(processing timing)에 개입하거나, **과도한 개입 깊이**(intervention depth)로 인해 사용자의 신뢰(TR)가 급격히 하락할 수 있다. 이는 단순히 작업 성공률(Task Capability, TC)을 높이는 것만으로는 충분하지 않음을 보여준다. 연구는 이러한 3T 요소가 **동시 최적화**되어야 하며, 이를 위해 Proactivity-Gym이라는 시뮬레이션 기반 평가 환경을 제안한다.
기술적 접근법
- **3T 원칙**: Task Capability (TC), Temporal Allocation (TA), Trust (TR)
- **설계 공간**: task scope, anticipation horizon, activation trigger, processing timing, intervention depth
- **시스템 구성 요소**: 사용자 및 환경 모델링, 백본 LLM, 에이전트 허네스
- **평가 환경**: Proactivity-Gym — 멀티데이 시나리오, 상태 유지 환경, 인격 조건화 시뮬레이션 사용자 포함
- **모델 및 허네스 구성**: 9개 모델(GPT 5.6, Claude, Qwen, Gemma 등) × 3개 허네스(OpenClaw, Claude Code, Codex) → 총 23개 구성
- **메트릭**: TC(0–100), TA(%) — 긴급 작업 우선화, TR-D(%) — 개입 깊이 일치율, TR-J(1–5) — 신뢰 평가
주요 결과
- Claude Opus 5가 TC 평균 65.1로 가장 높았으나, TA(51.7%)와 TR-D(52.4%)는 낮아 3T 간 불균형이 명확.
- 모든 모델에서 TA는 20% 이하로, 시간 할당 능력이 현저히 부족.
- TC와 TA, TR-D 간 상관관계는 약한 수준(r = 0.31, 0.34), TC와 TR-J는 강한 상관(r = 0.70).
- LLM 평가자(TR-J)는 개입 깊이 불일치를 상대적으로 허용하며, TC에 더 중점을 두는 경향.
- 30명의 사용자 실험에서 단일 개입 불일치가 신뢰를 급격히 하락시키며, 즉각적인 개입보다는 수면 시간에 예약된 도움을 선호함.
의의 및 한계
이 연구는 프로액티브 에이전트 설계에서 **작업 능력**(TC)만이 아닌, **시간 할당**(TA)과 **사용자 신뢰**(TR)를 함께 고려해야 한다는 점을 강조하며, 3T 최적화의 중요성을 입증한다. Proactivity-Gym은 시뮬레이션 기반 평가 환경으로, 에이전트의 **다양한 상호작용**을 고려한 평가가 가능하다는 점에서 학술적·실용적 가치가 있다.
그러나, 현재의 테스트베드는 **단순화된 자원 제약**과 **사용자 모델**을 기반으로 하며, **장기적 현실 세계 평가**는 아직 이루어지지 않았다. 또한, 3T 간의 **동시 최적화 알고리즘**은 제시되지 않았으며, 향후 연구 주제로 제시된다.
실용적 활용
이 연구는 개인 AI 에이전트가 사용자의 **수면 시간**이나 **공백 시간**을 활용해 작업을 수행하는 데 적용 가능하다. 예를 들어, OpenClaw, Claude Code, Codex와 같은 허네스를 사용한 에이전트는 사용자의 일정과 자원을 고려해 **적절한 시점에 도움을 제공**할 수 있다. 특히, 사용자의 **집중도 유지**와 **신뢰 구축**이 중요한 업무 자동화, 개인 비서, 교육 도우미 등에 활용 가능하다.