📌 TL;DR

VIRAL 将 Visual In-Context Learning 建模为一个视觉类比问题:

$$ x_s:x_t::x_q $$

模型首先观察示例图像对:

$x_s \rightarrow x_t$

然后推断其中隐含的视觉变换关系,并将相同关系作用到查询图像 $x_q$,生成目标图像 $y_q$。

VIRAL 的整体方案可以概括为:

VIRAL 的核心价值,是证明预训练图像编辑 DiT 在经过视觉类比训练后,可以通过示例图像统一完成感知、恢复和开放域编辑任务。


🎯 1. 论文解决什么问题?

Visual In-Context Learning 希望模型可以只根据视觉示例,理解并执行一个任务。

例如: