<aside>
MMCORE 是一个统一的多模态图像生成与编辑框架,通过引入可学习的查询 Token,从预训练视觉-语言模型中提取语义视觉嵌入,并作为扩散模型的条件输入,从而高效地将强大的理解与推理能力迁移到图像生成中。该方法避免了自回归模型与扩散模型的复杂耦合或从零训练,在降低计算成本的同时保持高质量生成效果。

</aside>
用约 30% 的计算量,通过让 MLLM 预测与 ViT/SigLIP 对齐的语义视觉嵌入,再以此条件驱动扩散模型,实现媲美 SOTA 统一多模态模型的图像生成与编辑能力。
多模态生成领域存在两大主流范式,各有优劣,难以直接融合:
| 范式 | 代表模型 | 优势 | 劣势 |
|---|---|---|---|
| AR / VLM | GPT-4o、LLaVA | 语言理解、推理、指令跟随 | 图像生成质量低,视觉 token 量化损失细节 |
| Diffusion / FM | Stable Diffusion、FLUX | 高保真图像生成 | 理解和推理能力弱,难以遵循复杂指令 |
⚠️ 直接融合的根本困难:扩散模型训练时需要在「干净特征(理解)」与「噪声特征(去噪)」之间交替,无法在单次前向传播中同时优化。深度融合方案(如 Transfusion、BAGEL)训练成本极高且相互干扰。
| 路线 | 代表方法 | 核心思路 | 资源需求 |
|---|---|---|---|
| 深度融合(高成本) | Transfusion、BAGEL、LMFusion、Janus-Pro、Show-o、LWM | 早期用单 Transformer 骨干处理交错图文 token;后续引入独立理解/生成分支,但通常用复制 LLM 权重初始化生成分支 | 需海量训练数据 + 私有数据,门槛极高 |
| 冻结 LLM + 扩散解码器(轻量) | MetaQueries、BLIP3-o、UniWorld、LightFusion | 将冻结的多模态 LLM 与可训练扩散解码器耦合;LightFusion 完全基于公开检查点与公开数据训练 | 相对低,无需大规模重新训练 |
📌 MMCORE 属于第二条路线的进一步发展,与 MetaQueries 等的关键区别:不冻结 MLLM,而是对其进行全量微调,并引入语义蒸馏对齐损失。
| 问题 | 描述 |
|---|---|
| 固定 Query 预算 | N 太小无法捕捉长提示细节;N 太大引入冗余,无法自适应上下文复杂度 |
| 对齐较弱 | 仅靠扩散损失监督导致查询表示与视觉潜在空间对齐不足;冻结 MLLM 骨干导致生成质量明显低于微调版本 |
| 阶段 | 方法 | 对齐方式 |
|---|---|---|
| 对比学习 | CLIP、ALIGN | 双编码器 + 对比目标,学习模态不变嵌入 |
| 更丰富的融合 | BLIP / BLIP-2、PaLI-X | Q-Former、多语言大规模视觉-语言融合 |
| 生成条件化 | LDM、SDXL、FLUX | 复用 CLIP/T5 文本嵌入作为扩散条件信号 |
| LLM → 扩散迁移 | MetaQueries、BLIP3-o、UniWorld | 将多模态 LLM 表示直接迁移给扩散解码器 |
| MMCORE(本文) | — | 全量微调 MLLM + ViT 蒸馏对齐 + 双路径条件 |