一 引言与介绍

背景

<aside>

生成式模型,特别是在大语言模型(LLMs)、视觉语言模型(VLMs)、统一多模态模型(UMMs)和图像生成模型等领域,正在推动通向通用人工智能的进程。虽然这些模型已经可以处理多模态输入,但大多数模型通常仅能生成单模态输出。为了实现类人交互,生成多轮交错多模态输出是至关重要的,尤其在推理、教育和设计等领域中。

然而,生成自然且一致的多模态内容依然是一大挑战,主要原因在于跨模态的输出需要保持一致性,且数据稀缺和跨模态上下文建模的困难加剧了这个问题。

</aside>

现有方法与限制

<aside>

早期的研究方法主要通过对图像-标题数据集微调大语言模型(如图像生成能力)来实现视觉合成,但这种方法仅能生成基础的视觉内容,无法捕捉复杂的上下文依赖。近期的统一多模态模型(UMMs)结合了自回归的token预测范式,或者扩散模型(如BAGEL和Mogao),并基于交错的文本-图像数据进行预训练。然而,由于交错数据的稀缺,监督信息稀疏,导致联合优化不稳定,并阻碍了模型学习长距离上下文依赖和模态转换的能力。

</aside>

Wan-Weaver模型:解决交错生成问题

<aside>

image.png

为了解决上述问题,Wan-Weaver提出了一个创新架构,旨在处理交错生成中的文本一致性、视觉一致性和跨模态一致性。具体方法包括:

  1. 文本一致性:通过现代的视觉语言模型(VLMs)来保证文本的一致性。
  2. 视觉一致性:使用参考引导的图像数据以及合成图像,确保生成图像在视觉上的一致性。
  3. 跨模态一致性:通过大规模文本到图像语料库中的对齐数据来有效学习跨模态一致性,同时引入规划能力来处理图像在序列中的位置和内容,确保长时间上下文的连贯性。 </aside>

架构与训练方式

<aside>

<aside>

<aside>

image.png

Wan-Weaver 的推理过程概览。 给定一个提示词,规划器专家Planner会自回归地生成纯文本和作为视觉化线索的密集提示。 通过因果多模态自注意力机制,视觉化器Visualizer与规划器进行交互,使其能够基于密集提示上下文和视觉参考合成图像。 生成的图文输出被追加到历史记录中并反馈给规划器,从而实现了一种能够保持长程上下文连贯性的迭代式交错生成过程。

</aside>

Wan-Weaver采用了MoT(Mixture of Experts)架构,并将模型分为两个部分:

这种架构实现了解耦训练:规划器在处理生成任务时会冻结,保持上下文特征传递,而可视化器则专注于生成视觉内容。通过引入密集提示上下文窗口,进一步提高了生成内容的一致性。

</aside>

</aside>

多任务训练与推理能力

<aside>

Wan-Weaver的规划器通过多任务训练表现出卓越的任务推理能力,使得生成任务不仅能够准确推理文本和图像的一致性,还能有效适应更复杂的多模态生成需求。通过训练,模型在推理过程中不仅能生成精确的文本描述,还能生成高质量的视觉内容。

</aside>

WeaverBench与性能评估

<aside>

为了全面评估Wan-Weaver的生成能力,研究者开发了一个专为交错生成设计的基准测试——WeaverBench。该基准测试涵盖了广泛的日常用例,提供了丰富的评估维度。实验结果表明,Wan-Weaver超越了领先的开源模型,并与商业模型Nano Banana相媲美。

</aside>

贡献总结

<aside>

二 相关工作

统一多模态模型(UMMs)

<aside>

UMMs旨在通过一个单一架构同时处理多模态理解与生成。当前的模型通常基于大语言模型(LLMs),扩展以支持多模态输入输出,采用下一 Token 预测来进行理解。最先进的视觉生成器则依赖扩散模型。主要的研究范式包括:

  1. 自回归(AR)模型:采用下一 Token 预测范式,编码图像为离散 Token。虽然存在视觉保真度较差的问题,但该方法应用广泛。
  2. AR与扩散模型融合:将扩散过程集成到自回归框架中,以提高视觉质量,但会牺牲多模态推理能力。
  3. 基于扩散的模型:完全摒弃自回归结构,尝试通过离散扩散或流匹配实现视觉-语言建模,取得了显著成果。 </aside>

交错多模态生成