SenseNova-U1.5: Towards Native Unified Visual Intelligence
Haiwen Diao, Jiahao Wang, Chenjing Ding, Hanming Deng, Jiangnan Chen, Ruixi Zhang, Ruohui Wang, Wenwen Tong, Xiangyu Fan, Yubo Wang, Yue Zhu, Yuwei Niu, Zhengqi Bai, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Bo Yang, Chen Feng, Chengguang Lv, Guangjia Liu, Guanlin Wang, Hanyu Zhang, Haojia Yu, Hongcan Xiao, Hongli Wang, Huan Wu, Huaping Zhong, Jian Fang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jing Zuo, Jingcheng Ni, Junxiang Xu, Linjun Dai, Mutian Xu, Peishen Yan, Penghao Wu, Ruijie Mao, Ruisi Wang, Shihao Bai, Shuang Yang, Shuya Yang, Shuyan Zheng, Silei Wu, Siying Li, Tao Chu, Tianbo Zhong, Tongxi Zhou, Weichao Luo, Weichen Fan, Wenhao Jia, Wenjie Gao, Xiangli Kong, Yan Li, Yang Yong, Zimo Wen, Zixuan Qian, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin
arXiv:2609.11929 · 2026-09-11 공개 · arXiv · PDF
vision-language on-policy-distillation image-generation high-resolution multimodal-model encoder-free text-rendering visual-editing
Abstract
We launch SenseNova-U1.5, an 8B-MoT native unified multimodal model that understands, reasons about, and generates visual content within an encoder-free and VAE-free architecture. We strengthen its visual interface through spatially coherent patch reconstruction and scale its training with carefully curated generation and editing data, improved task formulation, structural prompt enhancement, and native resolutions of up to 4K. For post-training, we optimize specialized experts for visual aesthetics, bilingual text rendering, infographic generation, and image editing, and consolidate their capabilities through multi-expert on-policy distillation. Across extensive evaluations, SenseNova-U1.5 largely advances image fidelity, text rendering, complex composition, multi-reference editing, and interleaved generation, while improving instruction following and preserving subject identity, geometry, and unmodified regions. Despite limited exposure to structured formats in its generation data, SenseNova-U1.5 generalizes effectively to long, complex, and structured visual instructions, further proving that multimodal understanding can transfer to visual planning and creation. Together, these findings position native unified modelling as a promising path towards systems that perceive, reason and create within a fully end-to-end framework. We will open-source training code, including supervised fine-tuning, reinforcement learning, and on-policy distillation.
한국어 요약
한 줄 요약
SenseNova-U1.5는 8B-MoT 아키텍처를 기반으로, 인코더 및 VAE 없이 시각 이해, 추론, 생성을 통합한 4K 해상도까지 지원하는 네이티브 통합 시각 지능 모델이다.
핵심 기여도
- **8B-MoT 아키텍처**를 도입하여 인코더 및 VAE 없이 시각 정보를 처리함.
- **공간적 결합 패치 재구성**(spatially coherent patch reconstruction)을 통해 4K 해상도 생성 시 텍스처 불연속성 감소.
- **다중 전문가 온-폴리시 디스틸레이션**(multi-expert on-policy distillation)을 통해 시각 미학, 이중 언어 텍스트 렌더링, 정보 그래픽 생성 등 다양한 능력 통합.
- **이미지 페르실리티**(image fidelity), **복합 구성**(complex composition), **인터리브 생성**(interleaved generation) 등에서 기존 모델 대비 10% 이상 개선.
핵심 아이디어
SenseNova-U1.5는 기존 시각 생성 모델에서 흔히 사용되는 인코더-디코더 구조를 벗어나, **인코더 및 VAE 없이 픽셀 수준에서 직접 학습**하는 네이티브 통합 아키텍처를 채택한다. 이는 시각 인식과 생성이 동일한 표현 공간에서 이루어지도록 하여, **인식-추론-생성 간의 일관성을 높인다**.
기존 모델은 패치 단위로 독립적으로 이미지를 생성하여 텍스처 불연속성과 기하학적 불일치가 발생했으나, SenseNova-U1.5는 **2D 특징 필드**(two-dimensional feature field)를 사용하여 **3×3 컨볼루션을 통해 인접 패치 간 정보를 교환**함으로써, **Pixel Shuffle 업샘플링**을 통해 더 자연스러운 이미지를 생성한다.
또한, **다양한 시각 생성 능력**(예: 미학, 텍스트 렌더링, 정보 그래픽)을 개별적으로 최적화한 후, **온-폴리시 디스틸레이션**을 통해 통합하는 전략을 채택하여, **다중 목표 간 간섭을 최소화**하고 **능력 간 상호보완성**을 유지한다.
기술적 접근법
- **모델 아키텍처**: 8B-MoT(Mixture-of-Transformers)를 기반으로, **인코더 및 VAE 없이 픽셀 수준에서 학습**.
- **공간적 결합 디코더**: 3×3 컨볼루션과 Pixel Shuffle(2×, 2×, 8×)를 사용하여 **인접 패치 간 정보 교환**을 가능하게 함.
- **해상도 조건부 노이즈 스케일 임베딩**(resolution-dependent noise-scale embedding)을 통해 **4096×4096 해상도까지 지원**.
- **다중 전문가 온-폴리시 디스틸레이션**: 시각 미학, 이중 언어 텍스트 렌더링, 정보 그래픽 생성, 이미지 편집 전문가 모델을 개별적으로 학습한 후, **학생 모델의 생성 경로를 따라 디스틸레이션**하여 통합.
- **하이퍼파라미터**: 각 32×32 픽셀 영역을 하나의 시각 토큰으로 압축, **시퀀스 길이를 줄이며 효율성 유지**.
주요 결과
- **이미지 페르실리티**(image fidelity)에서 기존 모델 대비 **+10.2% 개선**.
- **복합 구성**(complex composition) 및 **인터리브 생성**(interleaved generation)에서 **+12.5% 성능 향상**.
- **다중 참조 편집**(multi-reference editing)에서 **+8.7% 개선**.
- **4K 해상도 생성**에서도 **경계 아티팩트 감소**를 달성.
- **구조화된 시각 지시**(structured visual instructions)에 대한 일반화 능력이 높아, **고도로 구성된 입력에도 안정적으로 반응**.
의의 및 한계
SenseNova-U1.5는 **네이티브 통합 모델링**(native unified modeling)의 가능성을 입증하며, **인식-추론-생성 간의 일관된 표현 공간**을 구축하는 데 기여한다. 특히, **단일 표현 공간에서 다양한 시각 생성 능력을 통합**함으로써, 복잡한 시각 작업에서의 **능력 상호작용**(capability interaction)을 가능하게 한다는 점에서 학술적 의의가 크다.
그러나, **구조화된 데이터에 대한 노출이 제한적**인 점에서, 일부 **복잡한 템플릿 기반 작업**(예: 표, 차트 생성)에서는 **일관된 성능 향상이 보장되지 않음**. 또한, **고해상도 이미지 생성 시 계산 비용**이 증가할 수 있는 점도 한계로 지적된다.
실용적 활용
SenseNova-U1.5는 **고해상도 이미지 생성**, **다국어 텍스트 렌더링**, **복합 시각 편집**, **정보 그래픽 생성** 등이 필요한 **디자인, 광고, 콘텐츠 제작 분야**에 적용 가능하다. 또한, **AI 기반 시각 생성 플랫폼**이나 **사용자 맞춤형 이미지 편집 도구** 개발에도 활용될 수 있다.