한 줄 요약
SearchJev는 빠르고 신뢰도 높은 System-1 모델로, 검색 에이전트의 단기 결정을 직접 예측하고 System-2에 위임하는 이중 시스템을 제안한다.
핵심 기여도
- SearchJev는 스키마 조건에 따라 법적 선택지를 직접 점수화하며, 자동 생성 없이 결정을 내린다.
- SLCD(Soft-Label Learning for Calibrated Decisions)를 통해 불확실한 감독 데이터로부터 결정 확률을 학습하고 신뢰도를 보정한다.
- SearchDecision-Bench라는 6가지 검색 결정 유형을 통합한 벤치마크를 제안한다.
- Qwen3.5 모델 대비 5.2–5.3배 빠른 결정 속도와 41–74% 감소한 평균 예상 신뢰도 오차(ECE)를 달성한다.
핵심 아이디어
기존 검색 에이전트는 단기 결정을 생성형 언어 모델을 통해 처리하는 데, 이는 지연(latency)과 신뢰도 불확실성을 유발한다. SearchJev는 System-1 모델로, 검색 상태와 결정 스키마를 입력으로 받아 법적 선택지를 직접 점수화하는 방식을 채택한다. 이는 자동 생성 과정을 생략함으로써 처리 속도를 대폭 향상시킨다. 또한, SLCD를 통해 불확실한 감독 데이터를 소프트 라벨로 활용하여 결정 확률을 학습하고, 신뢰도를 보정함으로써 결정의 신뢰성을 높인다. 이는 기존 생성형 모델에서 자주 발생하는 신뢰도 오보(miscalibration) 문제를 해결한다.
기술적 접근법
- **System-1 Search Decision Model**: 검색 상태와 스키마를 입력으로 받아, 첫 번째 토큰의 로짓을 법적 선택 라벨에 정규화하여 결정 분포를 직접 생성한다.
- **SLCD (Soft-Label Learning for Calibrated Decisions)**: 소프트 라벨을 사용한 학습과 온도 보정을 통해 결정 확률을 학습하고 신뢰도를 보정한다.
- **Dual-System Search Agent**: SearchJev가 단기 결정을 처리하고, 불확실한 판단은 System-2에 위임한다. System-2는 계획, 쿼리 생성, 답변 구성만 담당한다.
- **SearchDecision-Bench**: 6가지 검색 결정 유형(라우팅, 리라이팅, 관련성, 충분성, 네비게이션, 검증)을 통합한 벤치마크로, 결정 품질, 신뢰도, 지연 시간을 평가한다.
주요 결과
- **SearchDecision-Bench**: SearchJev는 동일 크기의 Qwen3.5 자동 생성 모델 대비 5.2–5.3배 빠른 결정 속도를 기록하며, 평균 예상 신뢰도 오차(ECE)를 41–74% 감소시켰다.
- **BrowseComp-Plus**: 이중 시스템 에이전트는 활성 검색 시간을 3.7–4.7배 단축하면서 답변 정확도를 45%에서 최대 54%까지 향상시켰다.
의의 및 한계
SearchJev는 단기 결정을 생성 없이 직접 예측함으로써 검색 에이전트의 효율성과 신뢰도를 동시에 향상시킨다. 이중 시스템 구조는 System-2의 부담을 줄이며, 전체 검색 시간을 단축하는 데 기여한다. 또한, SearchDecision-Bench는 다양한 결정 유형을 통합한 평가 기준으로, 연구 및 개발에 유용한 도구가 될 수 있다. 그러나, SearchJev는 System-2의 판단에 의존하므로, System-2의 성능이 최종 결과에 큰 영향을 미칠 수 있다는 한계가 있다.
실용적 활용
SearchJev는 복잡한 검색 작업이 필요한 콘텐츠 추천, 고객 지원, 정보 검색 시스템 등에 적용할 수 있다. 특히, 실시간 결정이 필요한 환경에서 빠른 처리와 신뢰도 높은 판단을 요구하는 상황에 적합하다.