AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea

Qifan Yu, Wei Chow, Zhongqi Yue, Kaihang Pan, Yang Wu, Xiaoyang Wan, Juncheng Li, Siliang Tang, Hanwang Zhang, Yueting Zhuang

arXiv:2411.15738 · 2026-07-27 공개 · arXiv · PDF

diffusion-models image-editing multi-modal dataset stable-diffusion high-quality-data instruction-editing task-aware-routing

Abstract

Instruction-based image editing aims to modify specific image elements with natural language instructions. However, current models in this domain often struggle to execute complex user instructions accurately, as they are trained on low-quality data with limited editing types. We present AnyEdit, a comprehensive multi-modal instruction editing dataset, comprising 2.5 million high-quality editing pairs spanning over 20 editing types and five domains. We ensure the diversity and quality of the AnyEdit collection through three aspects: initial data diversity, adaptive editing process, and automated selection of editing results. Using the dataset, we further train a novel AnyEdit Stable Diffusion with task-aware routing and learnable task embedding for unified image editing. Comprehensive experiments on three benchmark datasets show that AnyEdit consistently boosts the performance of diffusion-based editing models. This presents prospects for developing instruction-driven image editing models that support human creativity.

한국어 요약

한 줄 요약

AnyEdit는 2.5M 개의 고질량 편집 쌍을 포함한 다모달 편집 데이터셋과 AnySD라는 새로운 통합 이미지 편집 모델을 제안하여 다양한 편집 작업에서 성능을 향상시킨다.

핵심 기여도

핵심 아이디어

AnyEdit은 기존 편집 데이터셋이 편향된 데이터, 제한된 편집 유형, 낮은 품질로 인해 복잡한 자연어 지시를 정확히 수행하지 못하는 문제를 해결하기 위해 설계되었다. 이 연구는 **initial data diversity**, **adaptive editing process**, **automated selection of editing results**의 세 가지 측면에서 데이터셋의 다양성과 품질을 보장한다. 특히, **counterfactual synthetic scenes**를 도입하여 꼬리 개념과 다양한 조합을 포함시켜 일반화 능력을 향상시켰다. 또한, **instruction validation pre-filter**와 **image assessment post-filter**를 통해 생성된 편집 결과의 품질을 자동으로 평가하고 필터링한다. 이러한 접근은 저자원 환경에서도 대규모 고질량 편집 데이터셋을 확장할 가능성을 열어준다.

기술적 접근법

AnySD는 **task-aware routing**, **learnable task embedding**, **visual prompt projector**의 세 가지 주요 구성 요소로 이루어진다.

주요 결과

의의 및 한계

AnyEdit은 다양한 도메인과 편집 유형을 아우르는 **통합 편집 프레임워크**를 제시하며, 자연어 기반 이미지 편집의 한계를 극복할 가능성을 제시한다. 특히, **25개 편집 타입**, **5개 도메인**, **2.5M 개의 편집 쌍**은 기존 데이터셋보다 훨씬 더 포괄적이다. 그러나, **복잡한 시각-언어 편집 작업**에서는 여전히 왜곡이 발생할 수 있으며, **실시간 편집 성능**이나 **사용자 맞춤화 가능성**은 명시되지 않음.

실용적 활용

AnyEdit은 디자인, 광고, 콘텐츠 제작 등 다양한 산업에서 자연어 기반 이미지 편집을 지원할 수 있다. 특히, **복잡한 공간 구성**, **시점 변경**, **공통 감각 이해**를 포함한 편집 작업에서 활용 가능하며, **사용자 창의성**을 지원하는 AI 도구로 활용될 수 있다.