🧠 1. 核心摘要

RelationAdapter 主要解决的问题是:如何让 Diffusion Transformer 从一对 before-after 图像中学习“视觉编辑关系”,并把这种关系迁移到新的 query image 上。

简单来说,它希望模型看到:

示例 source image → 示例 target image

之后能够理解:

这里发生了什么视觉变化?

然后把同样的变化应用到另一个输入图像上。

这篇文章的核心做法是:

不再简单把多张图像 token 拼在一起做 in-context editing,而是设计一个轻量级 RelationAdapter,专门从 source-target 图像对中提取 visual relation,再注入到 DiT 的 attention 过程中,指导新图像编辑。


🎯 2. 任务设定:Visual Relation Transfer

输入

模型输入通常包括:

输出

论文强调,visual prompt 图像对比单图参考更强,因为 source-target pair 不只提供风格或外观,还隐含了“变化关系”。这种变化可以包括语义、结构、风格、低层图像处理等多类编辑。