一句话核心
TUNA 通过将 VAE 编码器级联到表征编码器上,构建统一的连续视觉表征,使单一模型能够同时完成图像/视频理解、图像/视频生成和图像编辑任务,且在理解和生成上均达到 SOTA。
Understanding 与 Generation 的 Representation Mismatch
<aside>
TUNA 在以下任务同时领先:图像理解 | 图像生成 | 视频理解 | 视频生成 | 图像编辑
统一训练中:理解数据 和 生成数据并非互相竞争,而是 mutual benefit。这是 unified representation 的关键优势。
</aside>
UMM 的目标:
用单一模型同时完成:
- 多模态理解
- 多模态生成
<aside>
从头联合预训练理解目标和生成目标,理解和生成共享同一模型参数。TUNA 属于这一类。
将理解模型和生成模型通过 connector 拼接。
例如:BAGEL, Mogao
</aside>
以前 unified representation 为什么效果不够好?
<aside>
| 特点 | 问题 |
|---|---|
| 理解 encoder 与生成 encoder 分离 | representation mismatch |
| 各自任务很强 | 难以联合优化 |
| 通常采用 MoE或MoT | 引入额外参数,增加了训练和推理成本 |
| 时空压缩率不一致 | 相同的输入,表示编码器(如 SigLIP 与因果 VAE 编码器(如 Wan 2.1 VAE )的特征在(1)空间压缩(16× 与 8×)、(2)时间压缩(无与 4×)、(3)通道维度(1152 与 16)方面存在差异。这些差异在解耦模型中可能导致表示冲突,而统一表示则从本质上避免了此类不一致性 |
| 特点 | 问题 |
|---|---|
| 单一编码路径 | 很难同时兼顾生成与理解 |
| 结构简单 | 容易偏向某一任务 |
代表:
这种统一设计往往倾向于某一任务,而损害另一任务的表现。
以前 unified representation 失败的核心原因:
单一 encoder 往往只擅长:
- semantic或reconstruction
但无法同时兼顾。