한 줄 요약
12B 규모의 언어 모델에 검증된 지식을 바이트 단위로 이식하여 정확도를 80.0%에서 93.3%로 높이고, 추론 비용을 6,574배 절감하는 기술을 제시한다.
핵심 기여도
- **Taliesin**이라는 바이트-정확한 KV 캐시 이식 기술을 통해 12B 모델의 AIME 2025 정확도를 80.0%에서 93.3%로 향상.
- 8개 문제를 401,026토큰 대비 61토큰으로 해결, 에너지 소비를 8,700배 절감.
- **Galahad** 학습 루프를 통해 31B 모델에서 7/7의 이전 학습되지 않은 문제 해결.
- 32,768토큰에서 2,854,766토큰으로 컨텍스트 확장, 추가 메모리 없이 87배 증가.
핵심 아이디어
기존 언어 모델은 컨텍스트를 매번 재계산하며, 이는 높은 비용과 에너지 소비를 유발한다. 본 연구는 **KV 캐시**를 바이트 단위로 정확하게 저장하고, 필요 시 **graft**를 통해 재사용함으로써, 동일한 결과를 재현할 수 있는 기술을 제시한다.
**Taliesin**은 모델의 내부 상태를 **SHA-256 해시**로 검증하며, **KL divergence 0**, **100% argmax agreement**를 보장한다. 이는 모델이 동일한 입력에 대해 항상 동일한 출력을 내는 **bit-exactness**를 달성한 것이다. 특히, **own-position graft**가 유일한 정확한 작동 지점이며, 다른 위치로 이식 시 **floating-point rotary encoding**의 민감도로 인해 정확도가 떨어진다.
이 기술은 **Gemma-4-12B** 및 **Gemma-4-31B** 모델에서 검증되었으며, **Blackwell**, **Hopper**, **H100** GPU에서 모두 작동함을 확인했다.
기술적 접근법
- **KV 캐시**는 **byte-exact artifact**로 저장되며, **SHA-256 해시**로 검증.
- **graft**는 **own-position**에서만 정확하게 작동하며, 다른 위치로 이식 시 **residual error** 발생.
- **floating-point rotary encoding** 기반 모델에서 **exactness**를 달성하기 위해 **own-position**이 유일한 조건.
- **Galahad**는 **verify-then-cache** 루프를 통해 **verified solution**을 저장하고, 필요 시 **graft**로 재사용.
- **AIME 2025**에서 **Gemma-4-12B**는 **80.0% → 93.3%**로 성능 향상.
- **H100 GPU**에서 **31B 모델**은 7/7의 **held-out transfer** 성공.
주요 결과
- **AIME 2025**에서 **Gemma-4-12B**는 **80.0% → 93.3%** (베이스라인 대비 +13.3%)
- **8개 문제**는 **401,026토큰 대비 61토큰**으로 해결, **6,574배 토큰 절감**, **8,700배 에너지 절감**
- **컨텍스트 확장**: 32,768 → 2,854,766토큰 (87배), **추가 메모리 없이**
- **H100 GPU**에서 **31B 모델**은 **7/7 held-out transfer**, **8/8 recurrence**, **100% flywheel score**
- **Blackwell**, **Hopper**, **H100** GPU에서 모두 **byte-identical** 작동 확인
의의 및 한계
본 연구는 **frozen small model**에 **verified knowledge**를 추가하여 **성능**과 **비용**을 동시에 개선하는 기술을 제시한다. 기존 방식과 달리 **retraining**이나 **accelerator 확장** 없이도 가능하며, **exactness**를 통해 **capability claim**의 신뢰도를 높인다.
하지만, **graft**는 **own-position**에서만 정확하게 작동하며, 다른 위치로 이식 시 **residual error**가 발생한다. 또한, **floating-point rotary encoding** 기반 모델에서만 적용 가능하며, **position-sensitive**한 모델에서는 한계가 있다.
실용적 활용
- **AIME**, **LiveBench** 등 수학 문제 해결에 활용 가능
- **고비용 추론**이 필요한 산업 (예: 금융, 법률)에서 **캐시 기반 추론**으로 비용 절감
- **클라우드 인프라**에서 **GPU 메모리 절약** 및 **에너지 효율성 향상**에 기여