RelationAdapter 主要解决的问题是:如何让 Diffusion Transformer 从一对 before-after 图像中学习“视觉编辑关系”,并把这种关系迁移到新的 query image 上。
简单来说,它希望模型看到:
示例 source image → 示例 target image
之后能够理解:
这里发生了什么视觉变化?
然后把同样的变化应用到另一个输入图像上。
这篇文章的核心做法是:
不再简单把多张图像 token 拼在一起做 in-context editing,而是设计一个轻量级 RelationAdapter,专门从 source-target 图像对中提取 visual relation,再注入到 DiT 的 attention 过程中,指导新图像编辑。
模型输入通常包括:
论文强调,visual prompt 图像对比单图参考更强,因为 source-target pair 不只提供风格或外观,还隐含了“变化关系”。这种变化可以包括语义、结构、风格、低层图像处理等多类编辑。