한 줄 요약
LLM에 사전 학습 이후 지식을 효율적으로 통합하기 위한 in-parameter memory augmentation 방법론을 두 축으로 분류하고 정리한다.
핵심 기여도
- in-parameter memory (IPM) 방법을 **Parameter Placement** (Embedding, Attention, FFN, Hybrid)와 **Parameter Acquisition Time** (Offline, Online) 두 축으로 체계화.
- IPM을 **memory object** $ \phi $, **acquisition operator** $ \mathcal{A} $, **augmentation operator** $ \mathcal{C} $로 수식화하여 명확한 경계 설정.
- IPM의 개방 문제를 **interference**, **safety-aware acquisition**, **ICL과의 협력 설계**, **재귀적 자기 개선**으로 제시.
- 기존 ICL 기반 메모리 확장 대비 **제곱 비용 감소**, **추론 지연 감소** 효과 분석.
핵심 아이디어
기존 ICL 기반 메모리 확장은 사전 학습된 모델에 외부 정보를 토큰으로 주입하는 방식이지만, 이는 **context window 소모**와 **토큰 수에 비례한 계산 비용 증가**를 유발한다. IPM은 이와 달리, **추론 시점에 파라미터 공간에 메모리 객체를 조합**하여 정보를 재사용하는 방식을 제안한다. 이는 **LLM의 파라미터 공간을 메모리 매체로 활용**함으로써, **반복적인 토큰 인코딩 비용을 줄이고, 메모리 재사용을 가능하게 한다**. 핵심 통찰은, **메모리 객체 $ \phi $**가 추론 시점에 **모델 파라미터 $ \theta $**와 결합되며, 이는 **online 또는 offline 방식**으로 생성될 수 있다는 점이다.
기술적 접근법
- **Parameter Placement**: Embedding, Attention, FFN, Hybrid (2개 이상의 레이어 사용)
- **Parameter Acquisition Time**: Offline (배포 전 생성), Online (배포 중 생성)
- **Memory Object $ \phi $**는 추론 시점에 forward pass에 조합되며, 이는 **adapter**, **parameter-like object**로 표현 가능.
- **Acquisition Operator $ \mathcal{A} $**는 메모리 객체를 생성, **Augmentation Operator $ \mathcal{C} $**는 이를 모델에 통합.
- KV cache는 **token memory**로 분류하며, IPM의 범주에 포함되지 않음.
주요 결과
- IPM은 ICL 대비 **제곱 비용 증가를 피하고, 추론 지연 감소** 효과를 제공.
- **Offline IPM**은 사전 학습 이후의 정적 지식을 통합, **Online IPM**은 배포 중 동적 경험을 학습.
- **Hybrid Placement**는 Embedding과 Attention 레이어를 결합하여 메모리 효과를 극대화.
- **FFN 레이어에 IPM 적용** 시, 특정 도메인 지식의 표현력 향상 효과 관찰.
의의 및 한계
- IPM은 **LLM의 파라미터 공간을 메모리 매체로 활용**함으로써, **I/O 비용을 줄이고, 메모리 재사용을 가능하게** 하여 실용적 가치가 높음.
- 그러나 **메모리 간 간섭 (interference)**, **안전성 확보**, **ICL과의 협력 설계**, **재귀적 자기 개선** 등은 여전히 개방 문제.
- **KV cache를 IPM으로 구분하는 기준**은 명확하지 않으며, **token memory와 IPM의 경계 설정**이 필요.
실용적 활용
IPM은 **도메인별 지식 통합**, **사용자 선호 반영**, **대화 기반 에이전트의 경험 학습** 등에 적용 가능. 특히, **I/O 비용이 높은 대규모 배포 환경**에서 효율적인 메모리 관리가 필요한 경우 유용.