Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision

Long Cui, Xiaoqian Liu, Qi Qin, Yi Xin, Tao Lin, Jianguo Li, Linfeng Zhang

arXiv:2608.16812 · 2026-08-25 공개 · arXiv · PDF

diffusion-models image-generation image-editing training-efficiency dataset-generation model-performance data-fidelity edit-concepts

Abstract

Existing image editing frameworks predominantly follow the training paradigm of text-to-image diffusion models. However, extending this paradigm to image editing highlights two inherent discrepancies, specifically, the insufficient attention to edit concept granularity and the training inefficiency caused by sparse supervision signals. To address these issues, we establish a comprehensive hierarchical taxonomy featuring over 1,000 fine-grained edit concepts and build ConceptEdit-12M, a massive dataset of 12 million high-quality editing pairs via an improved synthesis framework. This library-driven approach effectively rectifies the distribution collapse of generated data while ensuring high data fidelity. Furthermore, we propose a dense supervision training strategy that synthesizes multiple non-interfering concepts into single image pairs. By providing richer learning signals, this strategy significantly enhances both training efficiency and overall model performance. Training results validate our strategy, significantly outperforming prior works. Finally, we present ConceptEdit-Bench, a granular evaluation suite designed to diagnose model capabilities across a vast array of real-world scenarios.

한국어 요약

한 줄 요약

이미지 편집 모델의 성능을 향상시키기 위해 개념 세분화와 밀집된 지도 학습 전략을 제안하며, ConceptEdit-12M 데이터셋과 ConceptEdit-Bench 평가 도구를 제시한다.

핵심 기여도

핵심 아이디어

기존 이미지 편집 프레임워크는 텍스트-이미지 확산 모델의 훈련 패러다임을 따르지만, 이는 편집 개념의 세분화 부족과 훈련 효율 저하라는 두 가지 문제를 야기한다. 이를 해결하기 위해, 연구팀은 1,000개 이상의 세분화된 편집 개념을 포함한 계층적 분류체계를 구축하고, 이를 기반으로 ConceptEdit-12M라는 대규모 데이터셋을 개발했다. 이는 기존 훈련 방식에서 편집 개념의 다양성보다는 소스 이미지의 다양성에 집중했던 한계를 극복한다. 또한, 단일 이미지 쌍에 여러 비중첩 편집 개념을 합성하여 밀집된 지도 신호를 제공함으로써 훈련 효율과 모델 성능을 동시에 향상시킨다.

기술적 접근법

주요 결과

의의 및 한계

이 연구는 이미지 편집 분야에서 개념 세분화와 밀집된 지도 학습의 중요성을 입증하며, 대규모 고질 데이터셋과 세분화 평가 도구를 제공함으로써 편집 모델의 일반화 능력과 신뢰성을 향상시킨다. 특히, ConceptEdit-Bench는 다양한 실제 시나리오에서 모델의 세부 편집 능력을 정밀하게 평가할 수 있는 기반을 제공한다. 그러나, 1,000개 이상의 편집 개념을 포함한 분류체계는 특정 도메인에 대한 과도한 특수화를 초래할 수 있으며, 데이터셋의 생성 과정에서 발생할 수 있는 편향성은 추가 연구가 필요하다.

실용적 활용

이 연구는 디지털 콘텐츠 제작, 인터페이스 디자인, 가상 환경 구축 등 다양한 산업 분야에서 사용자 지정 이미지 편집 기술의 정확성과 효율성을 향상시키는 데 활용될 수 있다. 특히, 대규모 편집 작업이 필요한 광고, 게임, 영화 제작 분야에서 실용적 가치가 높다.