한 줄 요약
Hybrid LLM은 LLM과 소형 모델의 장점을 결합한 쿼리 라우팅 방식으로, 40%까지 대형 모델 호출을 줄이며 품질 저하 없이 비용 효율성을 확보한다.
핵심 기여도
- **Hybrid LLM**이라는 새로운 추론 방식을 제안하여, LLM과 소형 모델을 결합하여 비용과 품질의 균형을 맞춘다.
- **쿼리 라우터**(router)를 설계하여, 예측된 쿼리 난이도와 원하는 품질 수준에 따라 소형 또는 대형 모델에 할당한다.
- **BART score**를 품질 평가 지표로 사용하여, 품질 저하 없이 40%까지 대형 모델 호출을 줄이는 실증 결과를 제시한다.
- **MixInstruct** 데이터셋을 사용한 실험에서, 라우터가 22%의 쿼리를 소형 모델로 할당하면서 1% 미만의 품질 저하를 보인다.
핵심 아이디어
LLM은 품질은 높지만 비용이 크고, 소형 모델은 비용은 낮지만 품질이 떨어진다. 이 연구는 이 두 모델의 장점을 결합하여, **쿼리 난이도**와 **원하는 품질 수준**에 따라 적절한 모델을 선택하는 **Hybrid LLM 추론 방식**을 제안한다. 핵심 아이디어는, 일부 쿼리는 소형 모델로도 충분히 처리할 수 있다는 점을 기반으로, **BART score**를 기반으로 품질 갭을 예측하고, 이를 라우터에 학습시켜 효율적으로 쿼리를 할당하는 것이다.
라우터는 **DeBERTa-v3-large**(300M 파라미터)를 백본으로 사용하며, **deterministic router**(r_det), **probabilistic router**(r_prob), **data transformation을 결합한 router**(r_trans)의 세 가지 버전을 실험적으로 비교한다. 이는 **LLM 응답의 생성성**(generative nature)과 **랜덤성**(inherent randomness)을 고려한 설계이다.
기술적 접근법
- **라우터**(router)는 DeBERTa-v3-large를 사용하며, 5 에포크 동안 학습된다.
- **MixInstruct** 데이터셋(10k 학습 샘플)을 사용하여, 각 샘플에 대해 10개의 응답을 생성한 후 BART score를 기반으로 품질 갭을 예측한다.
- **라우팅 기준**: 라우터 점수가 임계값 이상인 쿼리는 소형 모델로, 이하인 쿼리는 대형 모델로 할당된다.
- **비교 모델**: FLAN-T5 (800M, 11B), Llama-2 (7B, 13B), GPT-3.5-turbo를 사용.
- **비용 효율성 지표**: 소형 모델로 라우팅된 쿼리 비율(=cost advantage)을 사용.
주요 결과
- **MixInstruct** 데이터셋에서, 라우터는 22%의 쿼리를 소형 모델로 라우팅하면서 BART score 기준 **1% 미만의 품질 저하**를 보인다.
- **최대 40%까지 대형 모델 호출을 줄일 수 있으며**, 품질 저하 없이 비용을 절감한다.
- **라우터의 계산 오버헤드는 미미**하며, 라우팅 결정은 실시간으로 이루어질 수 있다.
- **라우터 성능은 r_trans가 가장 우수**하며, 데이터 변환을 통해 성능 향상이 관찰된다.
의의 및 한계
Hybrid LLM은 LLM의 높은 품질과 소형 모델의 낮은 비용을 결합한 새로운 추론 전략으로, **MLaaS 플랫폼**(예: HuggingFace, OpenAI)에서 유용하게 활용될 수 있다. 특히, **소규모 기업 및 개인 사용자**가 비용을 절감하면서도 품질을 유지할 수 있는 방안을 제시한다.
하지만, 현재 라우터는 **쿼리 입력만을 기반**으로 라우팅 결정을 내리므로, **태스크 정보**(task label)나 **추가 특징**(feature)를 활용한 라우팅 방식이 개선 방향이다. 또한, **다양한 모델 쌍**(N-model routing)이나 **OOD**(Out-of-Distribution) 데이터에 대한 일반화 능력도 향후 연구 주제로 제시된다.
실용적 활용
Hybrid LLM은 **MLaaS 플랫폼**(예: HuggingFace, OpenAI)에서 사용자 쿼리를 소형 모델로 라우팅하여 **비용 절감**을 도모할 수 있다. 또한, **엣지 기기**(노트북, 스마트폰)에서 소형 모델을 실행하고, 복잡한 쿼리는 클라우드에 요청하는 방식으로 **개인 사용자 및 소규모 기업**의 비용 부담을 줄일 수 있다.