한 줄 요약
ToolACE는 26,507개의 다양한 API를 기반으로 생성된 정확하고 복잡한 툴 학습 데이터를 통해 8B 파라미터 모델이 GPT-4 수준의 성능을 달성한 자동 생성 파이프라인입니다.
핵심 기여도
- 26,507개의 다양한 API를 포함한 API 풀을 TSS(Self-Evolution Synthesis)를 통해 생성.
- 복잡한 다중 에이전트 상호작용과 형식화된 사고 과정을 통해 다이얼로그 생성.
- Rule-based와 Model-based를 결합한 Dual-Layer Verification(DLV) 시스템으로 데이터 정확도 보장.
- 8B 파라미터의 ToolACE-8B 모델이 Berkeley Function-Calling 리더보드에서 최신 GPT-4 모델과 경쟁.
핵심 아이디어
기존 툴 호출 데이터는 수집 및 라벨링이 어려우며, 합성 데이터는 커버리지와 정확도가 부족한 문제가 있었다. ToolACE는 이 문제를 해결하기 위해 **TSS**(Tool Self-Evolution Synthesis)를 도입하여 다양한 도메인과 데이터 타입을 포함한 API 풀을 자동 생성한다. 또한, 다중 에이전트 간 상호작용을 통해 생성된 다이얼로그는 **형식화된 사고 과정**(Formalized Thinking)을 따르며, **DLV**(Dual-Layer Verification) 시스템을 통해 정확도를 보장한다. 이는 단순히 규칙 기반 검증을 넘어, LLM 기반의 내용 품질 검증을 추가하여 데이터 신뢰성을 높인다.
기술적 접근법
- **TSS**(Tool Self-Evolution Synthesis)를 통해 26,507개의 다양한 API를 포함한 API 풀 생성.
- 다이얼로그 생성 시 **형식화된 사고 과정**(Formalized Thinking)을 적용.
- **DLV**(Dual-Layer Verification) 시스템: 규칙 기반 검증 + LLM 기반 검증.
- **LLaMA3.1-8B-Instruct** 모델을 LoRA를 사용해 파라미터 효율적으로 미세 조정 (rank=16, alpha=32).
- 생성된 데이터로 학습한 모델은 **BFCL**(Berkeley Function-Calling Leaderboard)에서 평가.
주요 결과
- **ToolACE-8B** 모델이 **BFCL** 벤치마크에서 **GPT-4 수준의 성능** 달성.
- **Formalized Thinking** 적용 시 최종 패스율에서 **10% 절대 개선**.
- **DLV** 시스템 적용 시 AST(Executable Syntax Tree) 정확도와 전체 정확도에서 **기존 모델 대비 5~10% 개선**.
- **ToolACE_medium** 데이터셋(중간 복잡도)이 전체 및 툴 사용 정확도에서 가장 높은 성능 보임.
- **ToolACE_high** 데이터셋(높은 다양도)이 관련성 탐지 정확도에서 가장 높은 개선.
의의 및 한계
ToolACE는 툴 호출 데이터 생성의 **정확도**, **다양성**, **복잡도**를 동시에 강화한 체계적인 파이프라인으로, 기존 합성 데이터의 한계를 극복한다. 특히, **DLV** 시스템은 데이터 품질을 보장하며, **TSS**는 다양한 도메인의 API를 포함하여 모델의 일반화 능력을 향상시킨다. 그러나, **모든 API를 커버하는 것은 여전히 어려움**이며, **실제 세계 API와의 호환성 검증은 추가 연구 필요**하다. 또한, **모델 크기 제한**(8B)으로 인해 더 큰 모델과의 비교는 제한적일 수 있다.
실용적 활용
ToolACE는 **자동화된 워크플로우**, **재무 보고**, **여행 계획** 등 복잡한 툴 사용이 필요한 산업에서 활용 가능하다. 또한, **LLM 기반 에이전트 개발**, **API 통합 시스템**, **교육용 AI 도구** 등 다양한 연구 및 개발 분야에서 툴 호출 기능을 향상시키는 데 유용하게 사용될 수 있다.