引言

<aside> 💡

1.1 问题背景

当前主流的扩散模型(Diffusion Models)在图像美学生成上已取得显著成就,但在真实专业设计工作流中仍面临三大核心瓶颈:

  1. 绝对可控性不足:无法精确执行复杂的构图、布局和属性控制指令,难以满足设计稿精度要求。
  2. 复杂排版渲染困难:对于多行文字、多字体混排、密集文字版面(A4 页级别),现有模型极容易产生字形错误、字符糊掉、语义丢失等问题,是当前行业公认的顽固瓶颈。
  3. 严格身份一致性难以保持:在多图生成、系列图、角色设计等场景下,对同一人物或物体的外观一致性保持极差。

1.2 设计目标与定位

Wan-Image 的目标非常明确:将图像生成模型从"休闲创意合成器"范式切换为"专业级生产力工具"范式。它的核心思路是不把图像生成当作孤立的开放式任务,而是把它设计成能深度理解并执行复杂创意工作流的完整系统。

1.3 主要能力一览

1.4 📊 评测结果概述

系统架构

<aside> 💡

整体架构设计理念

image.png

Wan-Image 采用原生统一多模态架构(Natively Unified Multi-modal Architecture),将大语言模型的认知推理能力与扩散 Transformer 的高保真像素合成能力有机融合。整个系统的核心思想是:通过 MLLM-based Planner 与 DiT-based Visualizer 的协同协作,建立从语义理解到视觉生成的无缝过渡管道

架构层面一共包含四个核心模块:Planner(规划器)、Visualizer(可视化器)、Prompt Enhancer(提示词增强器)、Image Refiner(图像精炼器),以及贯穿全局的四通道 VAE。

</aside>

<aside>

Planner(规划器)

<aside>

Planner 是一个先进的多模态大语言模型(MLLM),承担系统的"大脑"角色。其核心职责有两个:深度语义推理(Deep Semantic Reasoning)和任务路由(Task Routing)。

具体而言,Planner 负责理解并拆解用户的复杂意图——无论是隐含的、模糊的、还是跨模态的需求——并将其精确映射到下游的生成任务类型(如文生图、图像编辑、图像系列生成等)。这一设计使系统具备自主决策和自动规划的能力,能够在语义理解与视觉生成之间实现流畅的自动化衔接。

Visualizer(可视化器)

<aside>

Visualizer 是基于 Diffusion Transformer(DiT)的高保真像素生成模块,负责将 Planner 产生的语义指令转化为实际的图像像素。

注意力机制设计是 Visualizer 的核心创新之一,具体采用了一种通用注意力机制(Generalized Attention Mechanism)结合专用调制策略(Dedicated Modulation Strategy):

文本 token、ViT token、VAE token 之间采用因果注意力(Causal Attention),以保留自回归生成的顺序性。

每张图像内部的视觉 token 之间采用双向注意力(Bidirectional Attention),以支持每张图像内部的全局一致性。

在图像系列生成任务(Image Series Generation)中,同一系列所有图像的视觉 token 之间进一步启用跨图双向注意力,从而实现跨图的身份一致性和风格连贯性。

对于图像编辑任务,输入图像的干净 VAE token(Clean VAE Tokens,即未加噪的原图编码)被额外送入 DiT 作为条件输入,与加噪后的 VAE token 一起。两类 token 均接受时间步嵌入(Timestep Embedding),并通过 AdaLN(Adaptive Layer Normalization)对每个 DiT 块进行调制,从而在编辑中精确保留原图的细粒度细节。

</aside>

四通道 VAE

<aside>

这是 Wan-Image 区别于绝大多数现有模型的标志性设计之一。传统图像 VAE 只处理 RGB 三通道,而 Wan-Image 的 VAE 扩展为四通道,原生支持 RGB + Alpha(透明通道)的联合建模。

架构设计要点:在输入阶段,骨干网络采用 8×8 空间下采样管道,整体压缩比达到 16×16。在编码器和解码器的多个阶段堆叠多个残差块,以增强深度非线性表示能力。这一设计在保持计算效率的同时,实现了对 RGBA 图像的高保真重建,对透明边界、半透明区域和细粒度纹理的恢复尤为稳定。

image.png

性能评估:在 5000 张 RGB 图像(512p 分辨率)的重建评测中,Wan-Image VAE 取得最高 PSNR(35.429)和最高 SSIM(0.958),同时 LPIPS 仅为 0.010,证明在 16×16 的高压缩比下仍能有效保留图像结构和细粒度细节。在 500 张 RGBA 图像(1080p 分辨率)的评测中,Wan-Image VAE 同样取得所有对比方法中最高的 PSNR,展示出对透明通道的卓越像素级重建精度。对比方法包括 FLUX.1 VAE、SD3.5 VAE、Qwen-Image-Layered VAE、HunyuanImage-3.0 VAE、Wan2.2 VAE 和 AlphaVAE。

image.png

视觉对比进一步显示:Wan-Image VAE 在文档区域的字符笔画和字形边界上保留得更为清晰,重建可读性远优于现有方法,且在更高压缩比下仍能恢复更清晰、更稳定的局部结构。

</aside>

</aside>

Prompt Enhancer(PE,提示词增强器)

<aside>

PE 模块的核心目标是消除用户输入与精确视觉输出之间的歧义。它通过大幅提升逻辑推理能力,精准捕捉用户意图中的细微之处,并将模糊的、简短的用户描述转化为语义丰富、细节完整的生成指令。

PE 不是"把 prompt 写花哨一点",而是根据任务类型做结构化的意图拆解:T2I 任务输出视觉细节补全,T2S 任务输出逐图描述列表,I2I 和 TI2S 任务输出"保留什么 / 改什么"的双字段结构。同时它还扮演任务分类器的角色,对通用场景直接放行不做干预。

PE 还有两种推理变体:

CoT 模式 vs 非 CoT 模式

两种变体都经过了 SFT + RL 两阶段训练,使用同一套数据联合训练覆盖全部四种任务。

image.png

效果验证(Figure 31):对比原始用户输入与 PE 增强后的版本,增强版本在纹理丰富度、光照复杂性和艺术构图方面均有显著提升,且不偏离用户原始的语义意图。

</aside>

Image Refiner(图像精炼器)

<aside>

Image Refiner 作用于 DiT 输出之后,通过增强高频细节将生成分辨率提升至 2K-4K,提供更高的清晰度、局部细节保真度和整体视觉质量。

两种工作模式的详细设计:

数据构建

<aside>

数据是 Wan-Image 从基础指令跟随能力跃升至专家级专业能力的核心驱动力。

第一层:数据来源与多模态检索系统

Wan-Image 不是简单地爬数据然后过滤,而是构建了一套主动检索 + 正反馈循环的数据获取系统。

image.png

image.png

核心问题是:对于很多关键类别(比如"高质量文字排版海报"、"特定风格的肖像"),仅靠关键词搜索很难找到真正匹配的图像,因为这些类别的核心特征往往是审美属性或构图逻辑,难以用文字精确表达。

为了解决这个问题,团队开发了一套多模态检索系统,支持五种检索模式:

检索完成后还有一个基于聚类的多样性重排序策略(cluster-based diversity re-ranking),在保持结果相关性的同时,提升检索结果的覆盖面和多样性,防止重复近似样本堆积。整个系统形成"检索 → 标注 → 迭代检索 → 数据清洗"的正反馈闭环。


第二层:五维图像质量评估算子

这是数据过滤的核心机制。团队构建了五个相互独立又互补的图像质量评估维度,统称为多维图像算子(Multi-Dimensional Image Operators)。

第一维:图像特征提取(Image Feature Extraction)

使用 SigLIP-2 提取语义嵌入(Semantic Embeddings),同时提取低层元数据。这些表征服务于两个目的:一是后续质量评估的基础表示,二是做同源图像的特征级去重,最大化数据集多样性。

第二维:美学质量评估(Aesthetic Quality Assessment)

多层级美学质量评估算子,量化的维度包括构图(composition)、色彩分布(color distribution)、整体视觉吸引力(overall visual appeal)等。筛选出更清晰、更自然、更符合人类审美偏好的图像。

第三维:AI 生成内容检测(AI-Generated Content Detection)

多层级 AI 生成内容检测算子,用来识别并过滤掉明显是 AI 生成的图像(artifact 特征明显的),优先保留具有真实感视觉特征、AI 生成可能性较低的图像。这是保证训练数据真实性和多样性的关键步骤。

第四维:低层信息评估(Low-Level Information Evaluation)

基于信息熵和压缩伪影检测的低层信息评估算子,具体检测以下问题:

低信息密度图像:比如大面积纯色背景、内容极度简单的图像。检测方式是计算边缘像素方差(edge pixel variance),方差过低说明图像内容过于单一。

</aside>

多阶段训练策略

训练阶段概述

Wan-Image 的训练分为四个连续阶段,每个阶段承担不同目标,整体形成从广泛预训练到精细对齐的递进轨迹。

预训练(Pre-training, PT)

在大规模数据上建立基础的文图生成能力,学习基本的语义-视觉对应关系。此阶段采用较宽泛的任务分布和较大比例的通用数据。

持续预训练(Continual Pre-training, CT)

在 PT 基础上,动态调整各任务类别的采样比例,逐步将重心转向对特定专业能力有益的数据。这一阶段通过精心的数据调度,推动模型从泛化能力向专项能力迁移。

监督微调(Supervised Fine-tuning, SFT)

SFT 阶段严格筛选数据:只保留通过了严格质量和美学双重过滤的优质样本,彻底剔除低质量数据。这是模型能力从"能用"到"好用"的关键跃升阶段。在整个 PT 到 SFT 的演进过程中,可以看到清晰的指令跟随改善轨迹和局部细节精炼效果(见论文 Figure 29)