한 줄 요약
OasisKV는 추론 시 HBM 메모리 부담을 줄이며 1.69× 이상의 처리량 향상을 달성하는 키-벨류 캐시 최적화 시스템이다.
핵심 기여도
- OasisKV는 HBM 외부 메모리에서 KV 캐시를 저장하고 필요 시만 HBM에 로드함으로써 메모리 용량을 확장한다.
- Lookahead 기반의 희소 KV 캐시 예측을 통해 0.7% 이하의 정확도 손실로 1.69× 처리량 향상을 달성한다.
- 멀티-GPU 및 PD-디스어그리게이션 환경에서 각각 2.1×, 2.1–2.3× 처리량 향상.
- vLLM 기반 구현으로, EAGLE-3와 같은 다중 토큰 예측 기법을 활용한 비동기식 prefetching을 지원.
핵심 아이디어
OasisKV는 추론 시 전체 KV 캐시를 HBM에 유지하지 않고, 필요 KV 블록만 HBM에 로드함으로써 메모리 용량 문제를 해결한다. 이는 추정된 미래 토큰(lookahead tokens)을 사용하여 중요 KV 블록을 사전에 예측하고, 이를 비동기적으로 prefetching하는 방식이다. 기존 희소 어텐션 접근법과 달리, OasisKV는 사전 토큰 생성 기법(EAGLE-3)을 활용하여 훈련 없이도 정확한 KV 액세스 패턴을 예측한다. 이로 인해 추가적인 예측기나 KV 양자화가 필요 없으며, 정확도 손실을 최소화하면서도 처리량을 향상시킬 수 있다.
기술적 접근법
- **Lookahead-driven KV sparsity prediction**: EAGLE-3를 활용한 다중 토큰 예측을 통해 미래 토큰을 생성하고, 이를 기반으로 KV 캐시 액세스를 예측.
- **비동기적 KV prefetching**: PCIe 및 네트워크를 통해 HBM보다 낮은 대역폭에서도 작동하는 비차단 prefetching 파이프라인.
- **Eviction scheme**: 활성 KV 캐시 업데이트를 통해 메모리 재사용 최대화 및 off-GPU 트래픽 제한.
- **vLLM 기반 구현**: 멀티-GPU 및 PD-디스어그리게이션 지원.
- **하이퍼파라미터**: KV 캐시 예산 2,048 토큰, 정확도 손실 0.7% 이하 유지.
주요 결과
- **Reasoning workload**: OasisKV는 vLLM 대비 1.69× 처리량 향상, 0.1% 정확도 손실.
- **Multi-GPU long-context serving**: 최대 2.1× 처리량 향상.
- **PD-디스어그리게이션**: 2.1–2.3× 처리량 향상, 6.5–9.7× 적은 KV 캐시 사용, 2.2–2.6× 적은 decode 노드 메모리 소비.
- **정확도**: 전체 어텐션 대비 0.7% 이하의 손실 유지.
의의 및 한계
OasisKV는 HBM 메모리벽을 돌파하여 대규모 LLM 추론의 처리량을 향상시키며, PD-디스어그리게이션 환경에서도 효율적으로 작동한다. 특히, 사전 토큰 생성 기법을 활용한 비동기 prefetching은 기존 KV retrieval 및 prefetch 접근법보다 낮은 오버헤드를 제공한다. 그러나 lookahead 기반 예측의 정확도가 모델 종류나 작업 유형에 따라 변동할 수 있으며, 이는 정확도 손실을 일정 수준 유지하는 데 영향을 줄 수 있다. 또한, 네트워크 대역폭이 낮은 환경에서는 off-GPU 트래픽 최적화가 필수적이다.
실용적 활용
OasisKV는 대규모 LLM 추론 서버, 특히 장문 추론 및 멀티-GPU 환경에서 유용하게 활용될 수 있다. 또한, 웹 에이전트, 코드 생성 에이전트 등 장기 히스토리 유지가 필요한 작업에 적합하며, 서버 비용 절감과 처리량 향상에 기여할 수 있다.