SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation

Zelin Tan, Yiqun Zhang, Hao Li, Zhiyao Cui, Hejia Geng, Shao Zhang, Hangfan Zhang, Yang Chen, Xiaosong Wang, Lilong Wang, Zhenfei Yin, Shuyue Hu, Chen Zhang, Lei Bai

arXiv:2608.02287 · 2026-08-04 공개 · arXiv · PDF

trajectory-generation supervised-finetuning large-scale-training synthetic-data-generation agent-skills skill-coverage skill-use verified-data

Abstract

Agent skills have become an important mechanism for equipping language-model agents with reusable procedural knowledge. However, providing skills alone does not guarantee that current models can effectively identify, apply, and coordinate them. To improve skill-use capabilities, we introduce SKT, a verified data synthesis pipeline that constructs skill-grounded tasks and executable trajectories from large collections of agent skills. SKT selects suitable single-skill and multi-skill configurations, synthesizes tasks through rule-based and agent-based verification with feedback-guided repair, and retains only successful trajectories that substantially use every required skill. Using 2,000 public skills, SKT produces 4,000 task packages and 27,164 verified trajectories. Based on the same pipeline and a disjoint test pool, we further construct SkillEval, a held-out executable benchmark for evaluating skill use. Experiments across diverse models, benchmarks, and agent harnesses show that supervised fine-tuning on SKT-generated trajectories consistently improves skill-use performance. Verification ablations, cross-harness evaluation, and scaling experiments further demonstrate that these gains depend on high-quality supervision, extend beyond a single agent interface, and increase with broader skill coverage. Together, these results establish verified data synthesis as an effective and scalable approach for skill-use training.

한국어 요약

한 줄 요약

SKT는 2,000개 공개 스킬을 기반으로 27,164개 검증된 실행 경로를 생성하여 LLM의 스킬 활용 능력을 향상시키는 데이터 합성 파이프라인이다.

핵심 기여도

핵심 아이디어

SKT는 LLM이 스킬을 효과적으로 활용할 수 있도록 하기 위해, **스킬-기반 태스크**와 **실행 가능한 경로**를 생성하는 데이터 합성 프레임워크이다. 기존 연구는 주로 스킬 검색, 내재화, 자기 개선에 집중했으나, SKT는 모델이 스킬을 **식별하고 조율하며 실행하는 능력**을 훈련하는 데 초점을 맞춘다. 핵심 아이디어는 **단일 스킬부터 복합 스킬 구성까지의 태스크 생성**과 **피드백 기반의 검증 및 수정**을 통해, 모델이 실제 상황에서 스킬을 정확히 사용할 수 있도록 유도하는 것이다. SKT는 **rule-based 및 agent-based verification**을 결합하여 생성된 태스크의 실행 가능성과 스킬 의존성을 보장한다.

기술적 접근법

SKT는 다음과 같은 3단계 파이프라인으로 구성된다:
1. **스킬 선택**: 공개 스킬 저장소에서 품질, 다양성, 조합 가능성에 따라 후보 스킬 풀을 구성.
2. **태스크 생성 및 검증**: 규칙 기반 및 에이전트 기반 검증을 통해 실행 가능한 태스크를 생성. 피드백이 있는 수리 단계를 통해 실패한 태스크는 수정.
3. **실행 경로 수집 및 검증**: 강력한 LLM을 통해 실행 경로를 수집하고, **실행 성공 및 스킬 활용 신뢰도**를 기준으로 필터링하여 고질량 감독 데이터로 사용.

주요 결과

의의 및 한계

SKT는 LLM이 스킬을 효과적으로 활용하도록 훈련하는 데 있어 **고질량 감독 데이터 생성**이라는 새로운 접근법을 제시한다. 특히, **실행 가능성과 스킬 의존성을 보장하는 검증 과정**은 기존 데이터 생성 방법과 차별화된다. 또한, SkillEval은 **스킬 활용 평가의 표준화**에 기여하며, 다양한 모델과 인터페이스에서의 일반화 가능성을 입증했다. 그러나 SKT는 **공개 스킬만을 기반으로 생성**되므로, 비공개 또는 특수 도메인 스킬을 활용하는 경우 한계가 있을 수 있다. 또한, 생성된 태스크의 **복잡도 조절**이 필요하다는 점도 언급된다.

실용적 활용

SKT는 대형 언어 모델이 다양한 도메인에서 스킬을 조합하여 복잡한 작업을 처리하도록 훈련하는 데 활용될 수 있다. 특히, **제약, 의료, 금융 등 전문 분야에서 도메인 스킬을 활용한 에이전트 개발**에 유용하며, **자동화된 시스템, 고객 지원, 데이터 분석 플랫폼** 등에서도 적용 가능하다.