한 줄 요약
ToolArtist는 완전한 에이전트 정책을 통해 외부 도구 사용과 이미지 생성을 통합한 통합 멀티모달 모델이다.
핵심 기여도
- **ToolArtist**: 단일 Unified Multimodal Model (UMM) 정책으로 외부 도구 사용, 추론, 이미지 생성을 통합한 완전한 에이전트 기반 이미지 생성 모델.
- **Post-training 전략**: 7,132개의 고품질 SFT 트래젝토리로 UMM에 에이전트 기능을 부여하는 전략을 설계.
- **RAD-GRPO 알고리즘**: Reason-Act-Draw GRPO를 통해 의도와 품질 보상 신호를 결합하여 전체 에이전트 트래젝토리를 최적화.
- **공개 데이터 및 인프라**: 7k SFT 트래젝토리와 SFT/RL 인프라를 공개하여 연구 재현 가능성을 높임.
핵심 아이디어
기존 이미지 생성 모델은 외부 도구와의 상호작용을 고정된 파이프라인 또는 부분적 에이전트 제어로 제한하여, 완전한 추론-도구 사용-생성 프로세스를 통합하지 못한다. ToolArtist는 이 문제를 해결하기 위해 **단일 UMM 정책** 내에서 외부 도구 사용과 이미지 생성을 동적으로 조율한다. 이는 사용자 요청에 대해 필요한 정보가 누락되었는지 판단하고, 적절한 도구를 선택적으로 호출한 후, 생성된 이미지를 반복적으로 수정하는 **Reason-Act-Draw** 프로세스를 가능하게 한다.
이 모델은 **Supervised Fine-Tuning (SFT)** 단계에서 교사 에이전트가 텍스트/이미지 검색 도구와 이미지 생성 도구를 사용해 트래젝토리를 생성하고, 이 트래젝토리를 UMM 호환 형식으로 변환하여 학습 데이터로 활용한다. 이후 **Reinforcement Learning (RL)** 단계에서 RAD-GRPO 알고리즘을 통해 **의도 보상**과 **품질 보상**을 결합하여 전체 트래젝토리를 최적화한다.
기술적 접근법
- **모델 구조**: Unified Multimodal Model (UMM) 기반.
- **SFT 단계**: 7,132개의 고품질 트래젝토리로 학습.
- **도구 사용**: 텍스트 검색, 이미지 검색, 이미지 생성 도구를 포함.
- **트래젝토리 변환**: 이미지 생성 도구는 숨기고, 생성된 이미지는 시각-캡션, 시각-토큰 스팬으로 표현.
- **RL 알고리즘**: Reason-Act-Draw GRPO (RAD-GRPO)를 사용.
- **보상 신호**: 의도 보상 (Intent Reward), 품질 보상 (Quality Reward)를 결합.
주요 결과
- **WISE 데이터셋**: ToolArtist는 완전한 에이전트 정책을 사용한 모델이 고정 파이프라인 또는 부분 에이전트 제어 모델보다 **일관된 성능 개선**을 보임.
- **WorldGenBench-Humanities**: 외부 도구 사용과 이미지 생성을 통합한 모델이 기존 UMM 기반 모델 대비 **+12.3%**의 정확도 향상.
- **7,132개 트래젝토리**: SFT 단계에서 사용한 고품질 데이터로, 이미지 생성 정확도와 도구 활용 능력을 동시에 향상.
의의 및 한계
ToolArtist는 외부 도구와 이미지 생성을 단일 정책으로 통합함으로써, 복잡한 의미론적 이해와 다단계 추론이 필요한 오픈월드 이미지 생성 문제를 해결하는 새로운 패러다임을 제시한다. 특히, **RAD-GRPO 알고리즘**을 통해 생성된 이미지의 의도 정확도와 시각 품질을 동시에 최적화할 수 있다는 점에서 학술적 가치가 높다. 또한, 공개된 **7k 트래젝토리 데이터와 SFT/RL 인프라**는 향후 연구의 재현성과 확장성을 높인다.
그러나, **7,132개의 트래젝토리**는 여전히 제한된 양이므로, 더 많은 데이터로 모델을 훈련시킬 경우 성능이 추가적으로 향상될 수 있다. 또한, **UMM 기반 모델의 계산 비용**이 높아 실용적 적용에는 한계가 있을 수 있다.
실용적 활용
ToolArtist는 복잡한 요청을 처리해야 하는 **미디어, 교육, 콘텐츠 생성 산업**에서 활용 가능하다. 예를 들어, 역사적 장면 재현, 과학적 개념 시각화, 맞춤형 디자인 생성 등에서 외부 지식을 활용한 정확하고 창의적인 이미지 생성이 필요할 때 유용하다. 또한, **AI 에이전트 기반 콘텐츠 플랫폼**에서 사용자 맞춤형 이미지 생성을 자동화하는 데 기여할 수 있다.