这篇论文想解决的问题是:
给定一个示例编辑对:
source image → target image,
模型能否学会其中的“编辑变化”,并把这个变化迁移到新的 query image 上?
传统 exemplar-based editing 方法通常需要 pair-of-pairs supervision,也就是训练时需要两组具有相同编辑语义的图像对。Delta-Adapter 的核心创新是:**不直接把完整的 source-target pair 喂给模型,而是用视觉 encoder 提取二者之间的 semantic delta,只把“变化方向”作为条件注入模型。**这样 target image 没有被模型直接看到,因此它可以作为监督目标,从而实现 single-pair supervision。
很多图像编辑任务很难用一句话准确描述,比如:
所以 exemplar-based editing 的动机是:
与其让用户写 prompt,不如直接给一个 before-after 示例对。
论文认为,示例图像对比文本指令更直接,也更少歧义。
已有方法通常需要: