한 줄 요약
LatentPress는 언어 모델이 텍스트 복원 없이 직접 읽을 수 있는 연속 메모리 토큰을 생성하여 대규모 컨텍스트를 압축하는 새로운 인터페이스를 제시한다.
핵심 기여도
- **LatentPress**는 언어 모델이 텍스트 복원 없이 연속 메모리 토큰을 직접 읽는 방식을 제안한다.
- **4.2M–26.2M 파라미터의 어댑터**만 학습하며, 디코더는 동결 상태로 유지된다.
- **LongMemEval**에서 7.70× 압축 시 0.504 정확도를 달성해 텍스트 요약(0.184)과 OCR 기반 압축(0.312)을 초과한다.
- **LongBench-QA**에서 4–8× 압축 시 원본 컨텍스트 성능과 동일하거나 뛰어난 결과를 보인다.
핵심 아이디어
기존의 압축 컨텍스트는 텍스트나 이미지 형태로 저장되어 언어 모델이 사용하기 전에 복호화가 필요했다. LatentPress는 이 문제를 해결하기 위해 **연속 메모리 토큰**(continuous memory tokens)이라는 새로운 표현 방식을 도입한다. 이 토큰은 언어 모델의 입력 임베딩 인터페이스를 통해 직접 읽히며, 텍스트 복원 과정이 필요 없다.
**Writer-Reader 구조**에서 Writer는 텍스트를 연속 벡터로 매핑하고, Reader는 이 벡터를 디코더의 입력 임베딩에 직접 전달한다. 이 구조는 대화 기록과 긴 문서 모두에 적용 가능하며, 압축률은 입력의 구조에 따라 조절된다. 예를 들어, 대화는 구조화된 기반 일정에 따라, 문서는 일관된 비율로 압축된다.
기술적 접근법
- **Writer**: 2개의 동결된 디코더 레이어와 **작은 어댑터**(4.2M–26.2M 파라미터)를 사용하여 텍스트를 연속 벡터로 매핑.
- **Reader**: 동결된 디코더가 연속 벡터를 입력 임베딩 인터페이스를 통해 직접 읽음.
- **압축률**: 4–16× 범위. 대화는 구조 기반 일정, 문서는 일관된 비율로 압축.
- **하이퍼파라미터**: 어댑터만 학습, 디코더는 동결.
주요 결과
- **LongMemEval**: 7.70× 압축 시 0.504 정확도 (원본 0.490 대비 +0.014, 텍스트 요약 0.184 대비 +0.320, OCR 기반 압축 0.312 대비 +0.192).
- **LongBench-QA**: 4–8× 압축 시 원본 컨텍스트 성능과 동일하거나 뛰어난 결과. 16× 압축 시 원본 성능 하락.
- **속도**: 43ms/대화로 텍스트 요약(10배 느림)보다 약 10배 빠르고, 읽기 속도는 원본 컨텍스트 대비 5–9배 빠름.
의의 및 한계
LatentPress는 언어 모델이 텍스트나 이미지 없이 직접 연속 토큰을 읽는 기반 인터페이스를 제시하며, **UltraChat → LongMemEval**, **LongMemEval → LongBench**의 두 가지 전이 설정에서 검증되었다. 이는 기계 중심 컨텍스트 인터페이스의 실용성을 입증한다.
하지만, **압축률 할당**은 여전히 수작업 휴리스틱에 의존하며, 자동화된 방식은 미래 연구 주제로 남아 있다. 또한, 16× 압축 시 성능 저하가 발생해 극한 압축 상황에서는 한계가 있다.
실용적 활용
LatentPress는 대화형 에이전트, 긴 문서 QA 시스템, 실시간 컨텍스트 압축이 필요한 산업 분야에 적용 가능하다. 특히, **UltraChat**과 **LongBench**와 같은 대규모 컨텍스트를 다루는 시스템에서 실시간 성능 향상과 저장 공간 절약에 기여할 수 있다.