한 줄 요약
CAST는 장기적 툴 호출 작업에서 신뢰성을 향상시키기 위한 비판 인식 훈련 프레임워크로, Qwen3 모델에서 Retail과 Telehealth에서 각각 10%와 9% 개선을 달성했다.
핵심 기여도
- CAST는 투자적 비판 모델(CAST-Critic)을 통해 투자적 행동 수준의 검증 신호를 생성하여 정책 최적화를 지원한다.
- Qwen3-32B 모델을 기반으로 훈련한 CAST-Policy-4B는 토큰 사용량을 줄이며 GPT-OSS-120B보다 Retail 작업에서 10% 이상, Telehealth에서 9% 개선된 성능을 보인다.
- CAST는 비판 신호의 품질과 정책의 실행 능력을 동시에 향상시켜, 82–88%의 오류 수정 성공률을 달성한다.
핵심 아이디어
CAST는 장기적 툴 호출 작업에서 단일 오류가 전체 작업 실패로 이어질 수 있는 문제를 해결하기 위해, 비판 인식 훈련 프레임워크를 제안한다. 기존 방법은 비용이 많이 드는 프롬프트 기반 비판 에이전트나, 훈련 시 구조화된 검증 신호를 생성하는 데 한계가 있었다. CAST는 투자적 비판 모델(CAST-Critic)을 통해 투자적 행동 수준의 검증 신호를 생성하고, 이를 기반으로 정책 모델(CAST-Policy)을 최적화한다. 이는 투자적 비판 모델이 각 단계에서 사용 가능한 정보만을 기반으로 행동의 유효성을 판단하도록 학습시키는 과정을 포함한다. CAST는 비판 신호를 생성하는 데이터 생성 파이프라인과, 정책 최적화를 위한 데이터 구성 프로세스를 통합한 다중 에이전트 시스템을 활용한다.
기술적 접근법
- CAST는 투자적 비판 모델(CAST-Critic)을 훈련시키기 위해, 투자적 비판 신호를 생성하는 데이터 생성 파이프라인을 사용한다.
- 투자적 비판 모델은 각 단계에서 사용 가능한 정보만을 기반으로 행동의 유효성을 판단하도록 학습된다.
- CAST-Policy는 CAST-Critic의 비판 신호를 기반으로 최적화되며, Qwen3-32B와 CAST-Policy-4B, CAST-Policy-8B 등 다양한 규모의 모델이 사용된다.
- 훈련 시, 비판 신호의 수량과 정책 모델의 반응에 따라 최적의 검증 예산(verification budget)이 결정된다. 예를 들어, CAST-Policy-4B는 4라운드에서 최고 성능을 보인다.
주요 결과
- Qwen3-32B 기반의 CAST-Policy-4B는 Retail 작업에서 GPT-OSS-120B 대비 10% 이상, Telehealth에서 9% 개선된 성능을 보인다.
- Retail 작업에서 pass^1은 22.6%, pass^4는 12.94% 개선되며, out-of-domain 설정에서는 평균 pass^1 3.7%, pass^4 5.1% 개선된다.
- CAST-Policy-4B는 Qwen3-32B보다 토큰 사용량을 줄이며, 비판 신호에 대한 저항이 2배 적어, 동일 성능을 달성한다.
- CAST-Critic은 GPT-4.1 대비 82–88%의 오류 수정 성공률을 달성하며, hallucination 탐지에서 우수한 성능을 보인다.
의의 및 한계
CAST는 장기적 툴 호출 작업에서 신뢰성을 향상시키는 새로운 훈련 프레임워크로, 비판 신호의 품질과 정책의 실행 능력을 동시에 개선한다. 특히, CAST는 비용 효율적인 훈련과 추론을 가능하게 하며, 다양한 도메인에서의 일반화 능력을 보인다. 그러나 CAST는 훈련 데이터의 질과 양에 크게 의존하며, 비판 모델이 과도하게 보수적인 판단을 내리는 경우 정책 모델의 유연성을 저해할 수 있다. 또한, CAST는 특정 도메인에서의 성능 개선을 보였지만, 모든 장기적 작업 환경에 대한 보편적 적용 가능성은 추가 연구가 필요하다.
실용적 활용
CAST는 소매, 항공, 통신, 텔레헬스 등 다양한 도메인에서 신뢰성 있는 툴 호출 작업을 필요로 하는 산업에 적용 가능하다. 특히, 비용 효율적인 추론과 반복 실행 환경에서의 안정성 향상이 필요한 시스템에 적합하다. CAST는 대규모 모델을 사용하지 않고도 높은 성능을 달성할 수 있어, 자원 제한이 있는 환경에서도 유용하게 활용될 수 있다.