<aside>
生成式模型,特别是在大语言模型(LLMs)、视觉语言模型(VLMs)、统一多模态模型(UMMs)和图像生成模型等领域,正在推动通向通用人工智能的进程。虽然这些模型已经可以处理多模态输入,但大多数模型通常仅能生成单模态输出。为了实现类人交互,生成多轮交错多模态输出是至关重要的,尤其在推理、教育和设计等领域中。
然而,生成自然且一致的多模态内容依然是一大挑战,主要原因在于跨模态的输出需要保持一致性,且数据稀缺和跨模态上下文建模的困难加剧了这个问题。
</aside>
<aside>
早期的研究方法主要通过对图像-标题数据集微调大语言模型(如图像生成能力)来实现视觉合成,但这种方法仅能生成基础的视觉内容,无法捕捉复杂的上下文依赖。近期的统一多模态模型(UMMs)结合了自回归的token预测范式,或者扩散模型(如BAGEL和Mogao),并基于交错的文本-图像数据进行预训练。然而,由于交错数据的稀缺,监督信息稀疏,导致联合优化不稳定,并阻碍了模型学习长距离上下文依赖和模态转换的能力。
</aside>
<aside>

为了解决上述问题,Wan-Weaver提出了一个创新架构,旨在处理交错生成中的文本一致性、视觉一致性和跨模态一致性。具体方法包括:
<aside>
<aside>
<aside>

Wan-Weaver 的推理过程概览。 给定一个提示词,规划器专家Planner会自回归地生成纯文本和作为视觉化线索的密集提示。 通过因果多模态自注意力机制,视觉化器Visualizer与规划器进行交互,使其能够基于密集提示上下文和视觉参考合成图像。 生成的图文输出被追加到历史记录中并反馈给规划器,从而实现了一种能够保持长程上下文连贯性的迭代式交错生成过程。
</aside>
Wan-Weaver采用了MoT(Mixture of Experts)架构,并将模型分为两个部分:
这种架构实现了解耦训练:规划器在处理生成任务时会冻结,保持上下文特征传递,而可视化器则专注于生成视觉内容。通过引入密集提示上下文窗口,进一步提高了生成内容的一致性。
</aside>
</aside>
<aside>
Wan-Weaver的规划器通过多任务训练表现出卓越的任务推理能力,使得生成任务不仅能够准确推理文本和图像的一致性,还能有效适应更复杂的多模态生成需求。通过训练,模型在推理过程中不仅能生成精确的文本描述,还能生成高质量的视觉内容。
</aside>
<aside>
为了全面评估Wan-Weaver的生成能力,研究者开发了一个专为交错生成设计的基准测试——WeaverBench。该基准测试涵盖了广泛的日常用例,提供了丰富的评估维度。实验结果表明,Wan-Weaver超越了领先的开源模型,并与商业模型Nano Banana相媲美。
</aside>
<aside>
统一多模态模型(UMMs)
<aside>
UMMs旨在通过一个单一架构同时处理多模态理解与生成。当前的模型通常基于大语言模型(LLMs),扩展以支持多模态输入输出,采用下一 Token 预测来进行理解。最先进的视觉生成器则依赖扩散模型。主要的研究范式包括:
交错多模态生成