一句话总结: ViBT 将 Brownian Bridge 扩展至 20B 参数的 Transformer,彻底抛弃 noise-to-vision 范式,以 vision-to-vision 的数据到数据直接映射方式完成图像/视频翻译,推理速度比条件扩散快 2~4×,却只需极少量训练数据。


💡 核心亮点


🌱 背景与动机

现有范式的问题:为什么要绕过噪声?

传统条件扩散模型(ControlNet、IP-Adapter、Wan 视频模型等)遵循 noise-to-vision 范式:

噪声 z ~ N(0, I)  →  [迭代去噪 + 条件注入]  →  目标图像/视频

这对于条件生成任务存在三个根本矛盾:

  1. 信息浪费:源图像信息在加噪时被完全破坏,再通过 cross-attention 重新注入——信息绕了一大圈
  2. 路径不自然:图像编辑、风格迁移、着色等任务中,输入输出本身高度相似,没必要过一个完全不同的噪声态
  3. Token 开销大:在 DiT 架构下,额外的 Condition Encoder 和条件 token 带来巨大计算开销,在视频任务中尤为突出

ViBT 的核心主张

"如果源和目标本来就相似,为什么不直接学习连接它们的路径?"

这正是 Bridge Models 的核心——构建直接连接源分布与目标分布的随机过程,无需绕道噪声。