🧠 TL;DR

这篇论文想解决的问题是:

给定一个示例编辑对:

source image → target image,

模型能否学会其中的“编辑变化”,并把这个变化迁移到新的 query image 上?

传统 exemplar-based editing 方法通常需要 pair-of-pairs supervision,也就是训练时需要两组具有相同编辑语义的图像对。Delta-Adapter 的核心创新是:**不直接把完整的 source-target pair 喂给模型,而是用视觉 encoder 提取二者之间的 semantic delta,只把“变化方向”作为条件注入模型。**这样 target image 没有被模型直接看到,因此它可以作为监督目标,从而实现 single-pair supervision。


🎯 论文想解决什么问题?

1. 文本 prompt 描述编辑意图不够精确

很多图像编辑任务很难用一句话准确描述,比如:

所以 exemplar-based editing 的动机是:

与其让用户写 prompt,不如直接给一个 before-after 示例对。

论文认为,示例图像对比文本指令更直接,也更少歧义。


🧱 旧方法的问题:Pair-of-Pairs 太难 scale

已有方法通常需要: