한 줄 요약
SKT는 2,000개 공개 스킬을 기반으로 27,164개 검증된 실행 경로를 생성하여 LLM의 스킬 활용 능력을 향상시키는 데이터 합성 파이프라인이다.
핵심 기여도
- SKT라는 3단계 파이프라인을 제안하여, 스킬 선택, 태스크 생성, 실행 경로 검증을 통합.
- 2,000개 공개 스킬을 기반으로 4,000개 태스크 패키지와 27,164개 검증된 실행 경로 생성.
- SkillEval이라는 새로운 스킬 활용 평가 벤치마크를 제시.
- Qwen3.5-9B, Gemma 4 E4B-IT 모델에서 SKT 학습이 성능을 일관되게 향상시킴.
핵심 아이디어
SKT는 LLM이 스킬을 효과적으로 활용할 수 있도록 하기 위해, **스킬-기반 태스크**와 **실행 가능한 경로**를 생성하는 데이터 합성 프레임워크이다. 기존 연구는 주로 스킬 검색, 내재화, 자기 개선에 집중했으나, SKT는 모델이 스킬을 **식별하고 조율하며 실행하는 능력**을 훈련하는 데 초점을 맞춘다. 핵심 아이디어는 **단일 스킬부터 복합 스킬 구성까지의 태스크 생성**과 **피드백 기반의 검증 및 수정**을 통해, 모델이 실제 상황에서 스킬을 정확히 사용할 수 있도록 유도하는 것이다. SKT는 **rule-based 및 agent-based verification**을 결합하여 생성된 태스크의 실행 가능성과 스킬 의존성을 보장한다.
기술적 접근법
SKT는 다음과 같은 3단계 파이프라인으로 구성된다:
1. **스킬 선택**: 공개 스킬 저장소에서 품질, 다양성, 조합 가능성에 따라 후보 스킬 풀을 구성.
2. **태스크 생성 및 검증**: 규칙 기반 및 에이전트 기반 검증을 통해 실행 가능한 태스크를 생성. 피드백이 있는 수리 단계를 통해 실패한 태스크는 수정.
3. **실행 경로 수집 및 검증**: 강력한 LLM을 통해 실행 경로를 수집하고, **실행 성공 및 스킬 활용 신뢰도**를 기준으로 필터링하여 고질량 감독 데이터로 사용.
- 사용된 모델: Qwen3.5-9B, Gemma 4 E4B-IT
- 생성된 데이터: 4,000개 태스크 패키지, 27,164개 실행 경로
- 평가 벤치마크: SkillsBench, MolBench-Bind, AgentSkillOS-bench, SkillEval
주요 결과
- Qwen3.5-9B 모델은 SKT 학습 후 SkillsBench에서 +12.3%, MolBench-Bind에서 +9.1% 성능 향상.
- Gemma 4 E4B-IT 모델은 AgentSkillOS-bench에서 +15.6% 개선.
- SkillEval에서 SKT 학습 모델이 베이스라인 대비 +18.2% 성능 향상.
- **Verification ablation 실험**에서, 검증 단계 제거 시 성능이 7.4% 감소함을 확인.
- **Cross-harness 평가**에서 SKT 학습 모델이 다양한 에이전트 인터페이스에서 일관된 성능을 보임.
의의 및 한계
SKT는 LLM이 스킬을 효과적으로 활용하도록 훈련하는 데 있어 **고질량 감독 데이터 생성**이라는 새로운 접근법을 제시한다. 특히, **실행 가능성과 스킬 의존성을 보장하는 검증 과정**은 기존 데이터 생성 방법과 차별화된다. 또한, SkillEval은 **스킬 활용 평가의 표준화**에 기여하며, 다양한 모델과 인터페이스에서의 일반화 가능성을 입증했다. 그러나 SKT는 **공개 스킬만을 기반으로 생성**되므로, 비공개 또는 특수 도메인 스킬을 활용하는 경우 한계가 있을 수 있다. 또한, 생성된 태스크의 **복잡도 조절**이 필요하다는 점도 언급된다.
실용적 활용
SKT는 대형 언어 모델이 다양한 도메인에서 스킬을 조합하여 복잡한 작업을 처리하도록 훈련하는 데 활용될 수 있다. 특히, **제약, 의료, 금융 등 전문 분야에서 도메인 스킬을 활용한 에이전트 개발**에 유용하며, **자동화된 시스템, 고객 지원, 데이터 분석 플랫폼** 등에서도 적용 가능하다.