一句话核心

TUNA 通过将 VAE 编码器级联到表征编码器上,构建统一的连续视觉表征,使单一模型能够同时完成图像/视频理解、图像/视频生成和图像编辑任务,且在理解和生成上均达到 SOTA。

Understanding 与 Generation 的 Representation Mismatch

image.png


🔥 核心贡献

<aside>

1. 统一视觉表征Unified Representation

2. 全任务 SOTA

TUNA 在以下任务同时领先:图像理解 | 图像生成 | 视频理解 | 视频生成 | 图像编辑

3. 联合训练互促

统一训练中:理解数据 和 生成数据并非互相竞争,而是 mutual benefit。这是 unified representation 的关键优势。

</aside>

📖 研究背景与核心问题

什么是 Unified Multimodal Model(UMM)?

UMM 的目标:

用单一模型同时完成:

两类 UMM

<aside>

1. Native UMM(原生 UMM)

从头联合预训练理解目标和生成目标,理解和生成共享同一模型参数。TUNA 属于这一类。

2. Composite UMM(组合式)

将理解模型和生成模型通过 connector 拼接。

例如:BAGEL, Mogao

</aside>

⚠️ 核心问题

以前 unified representation 为什么效果不够好?


<aside>

路线 1:解耦表征

特点 问题
理解 encoder 与生成 encoder 分离 representation mismatch
各自任务很强 难以联合优化
通常采用 MoE或MoT 引入额外参数,增加了训练和推理成本
时空压缩率不一致 相同的输入,表示编码器(如 SigLIP 与因果 VAE 编码器(如 Wan 2.1 VAE )的特征在(1)空间压缩(16× 与 8×)、(2)时间压缩(无与 4×)、(3)通道维度(1152 与 16)方面存在差异。这些差异在解耦模型中可能导致表示冲突,而统一表示则从本质上避免了此类不一致性

路线 2:统一表征

特点 问题
单一编码路径 很难同时兼顾生成与理解
结构简单 容易偏向某一任务

代表:

这种统一设计往往倾向于某一任务,而损害另一任务的表现。



作者关键观察

以前 unified representation 失败的核心原因:

单一 encoder 往往只擅长:

但无法同时兼顾。