Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning

Sikuan Yan, Xiufeng Yang, Zuchao Huang, Ercong Nie, Zifeng Ding, Zonggen Li, Xiaowen Ma, Hinrich Schutze, Volker Tresp, Yunpu Ma

arXiv:2508.19828 · 2026-07-27 공개 · arXiv · PDF

reinforcement-learning llm-agents grpo ppo long-horizon-reasoning memory-management external-memory longmemeval

Abstract

Large Language Models (LLMs) have demonstrated impressive capabilities across a wide range of NLP tasks, but they remain fundamentally stateless, constrained by limited context windows that hinder long-horizon reasoning. Recent efforts to address this limitation often augment LLMs with an external memory bank, yet most existing pipelines are static and heuristic-driven, lacking a learned mechanism for deciding what to store, update, or retrieve. We present Memory-R1, a reinforcement learning (RL) framework that equips LLMs with the ability to actively manage and utilize external memory through two specialized agents: a Memory Manager that learns structured operations, including ADD, UPDATE, DELETE, and NOOP; and an Answer Agent that pre-selects and reasons over relevant entries. Both agents are fine-tuned with outcome-driven RL (PPO and GRPO), enabling adaptive memory management with minimal supervision. With only 152 training QA pairs, Memory-R1 outperforms strong baselines and generalizes across diverse question types, three benchmarks (LoCoMo, MSC, LongMemEval), and multiple model scales (3B-14B).

한국어 요약

한 줄 요약

Memory-R1은 강화학습을 통해 LLM이 외부 메모리를 적극적으로 관리하고 활용할 수 있도록 하는 첫 번째 프레임워크이다.

핵심 기여도

핵심 아이디어

기존 LLM 메모리 관리 시스템은 대부분 정적이고 휴리스틱 기반으로, 무엇을 저장하거나 삭제할지에 대한 학습된 메커니즘이 부족하다. Memory-R1은 강화학습을 도입하여, 메모리 연산과 추론을 모두 학습 가능한 에이전트로 분리한다. Memory Manager는 ADD, UPDATE, DELETE, NOOP 연산을 학습하여 메모리 은행을 적응적으로 관리하고, Answer Agent는 RAG를 통해 검색된 메모리 중 가장 관련성 높은 항목을 선택하고 추론한다. 두 에이전트는 모두 PPO와 GRPO 알고리즘을 사용해 최소한의 감독 데이터(152개 QA 페어)로 학습되며, 이는 기존 휴리스틱 접근법에 비해 훨씬 유연하고 정확한 메모리 관리를 가능하게 한다.

기술적 접근법

주요 결과

의의 및 한계

Memory-R1은 LLM이 외부 메모리를 적극적으로 관리하고 활용할 수 있도록 하는 첫 번째 RL 기반 프레임워크로, 장기 기억 관리와 추론 능력을 동시에 향상시킨다. 특히, 최소한의 감독 데이터로도 뛰어난 성능을 내는 점에서 실용적 가치가 크다. 그러나 현재는 152개의 QA 페어로 학습된 경우에만 성능이 입증되었으며, 더 복잡한 대화 상황이나 더 긴 메모리 히스토리에 대한 평가가 필요하다. 또한, 메모리 은행의 구조와 크기, 연산 정책의 최적화에 대한 연구가 앞으로 확장되어야 한다.

실용적 활용

Memory-R1은 대화형 AI, 개인화된 추천 시스템, 지속적인 학습을 요구하는 고객 지원 플랫폼 등에 적용 가능하다. 특히, 사용자와의 장기 대화를 유지하면서 정보를 기억하고 활용해야 하는 상황에서 유용하며, LLM 기반 에이전트의 지속적 추론 능력을 향상시키는 데 기여할 수 있다.