摘要

<aside>

MMCORE 是一个统一的多模态图像生成与编辑框架,通过引入可学习的查询 Token,从预训练视觉-语言模型中提取语义视觉嵌入,并作为扩散模型的条件输入,从而高效地将强大的理解与推理能力迁移到图像生成中。该方法避免了自回归模型与扩散模型的复杂耦合或从零训练,在降低计算成本的同时保持高质量生成效果。

image.png

</aside>

用约 30% 的计算量,通过让 MLLM 预测与 ViT/SigLIP 对齐的语义视觉嵌入,再以此条件驱动扩散模型,实现媲美 SOTA 统一多模态模型的图像生成与编辑能力。


🔍 问题背景

多模态生成领域存在两大主流范式,各有优劣,难以直接融合:

范式 代表模型 优势 劣势
AR / VLM GPT-4o、LLaVA 语言理解、推理、指令跟随 图像生成质量低,视觉 token 量化损失细节
Diffusion / FM Stable Diffusion、FLUX 高保真图像生成 理解和推理能力弱,难以遵循复杂指令

⚠️ 直接融合的根本困难:扩散模型训练时需要在「干净特征(理解)」与「噪声特征(去噪)」之间交替,无法在单次前向传播中同时优化。深度融合方案(如 Transfusion、BAGEL)训练成本极高且相互干扰。


📚 相关工作

统一多模态模型(UMM)的两条路线

路线 代表方法 核心思路 资源需求
深度融合(高成本) Transfusion、BAGEL、LMFusion、Janus-Pro、Show-o、LWM 早期用单 Transformer 骨干处理交错图文 token;后续引入独立理解/生成分支,但通常用复制 LLM 权重初始化生成分支 需海量训练数据 + 私有数据,门槛极高
冻结 LLM + 扩散解码器(轻量) MetaQueries、BLIP3-o、UniWorld、LightFusion 将冻结的多模态 LLM 与可训练扩散解码器耦合;LightFusion 完全基于公开检查点与公开数据训练 相对低,无需大规模重新训练

📌 MMCORE 属于第二条路线的进一步发展,与 MetaQueries 等的关键区别:不冻结 MLLM,而是对其进行全量微调,并引入语义蒸馏对齐损失。

MetaQueries 的两个缺陷(MMCORE 的改进出发点)

问题 描述
固定 Query 预算 N 太小无法捕捉长提示细节;N 太大引入冗余,无法自适应上下文复杂度
对齐较弱 仅靠扩散损失监督导致查询表示与视觉潜在空间对齐不足;冻结 MLLM 骨干导致生成质量明显低于微调版本

跨模态对齐方法演化脉络

阶段 方法 对齐方式
对比学习 CLIP、ALIGN 双编码器 + 对比目标,学习模态不变嵌入
更丰富的融合 BLIP / BLIP-2、PaLI-X Q-Former、多语言大规模视觉-语言融合
生成条件化 LDM、SDXL、FLUX 复用 CLIP/T5 文本嵌入作为扩散条件信号
LLM → 扩散迁移 MetaQueries、BLIP3-o、UniWorld 将多模态 LLM 表示直接迁移给扩散解码器
MMCORE(本文) — 全量微调 MLLM + ViT 蒸馏对齐 + 双路径条件

🏗️ 方法详解

整体架构