一句话总结: ViBT 将 Brownian Bridge 扩展至 20B 参数的 Transformer,彻底抛弃 noise-to-vision 范式,以 vision-to-vision 的数据到数据直接映射方式完成图像/视频翻译,推理速度比条件扩散快 2~4×,却只需极少量训练数据。
💡 核心亮点
- 🚀 首个大规模 Bridge Transformer:20B(图像)+ 1.3B(视频)参数
- 🔕 完全无噪声推理:vision-to-vision,不经过 Gaussian 噪声
- ⚡ 图像快 2.28×,视频快 4.03×:省去 Condition Encoder 和额外 token
- 🧮 方差稳定速度匹配:解决大规模训练中的梯度爆炸问题
- 📦 极少数据:图像编辑仅用 ~6K 对,视频仅用 ~10K 段
🌱 背景与动机
现有范式的问题:为什么要绕过噪声?
传统条件扩散模型(ControlNet、IP-Adapter、Wan 视频模型等)遵循 noise-to-vision 范式:
噪声 z ~ N(0, I) → [迭代去噪 + 条件注入] → 目标图像/视频
这对于条件生成任务存在三个根本矛盾:
- 信息浪费:源图像信息在加噪时被完全破坏,再通过 cross-attention 重新注入——信息绕了一大圈
- 路径不自然:图像编辑、风格迁移、着色等任务中,输入输出本身高度相似,没必要过一个完全不同的噪声态
- Token 开销大:在 DiT 架构下,额外的 Condition Encoder 和条件 token 带来巨大计算开销,在视频任务中尤为突出
ViBT 的核心主张
"如果源和目标本来就相似,为什么不直接学习连接它们的路径?"
这正是 Bridge Models 的核心——构建直接连接源分布与目标分布的随机过程,无需绕道噪声。