🧠 1. 摘要

EditTransfer++ 的核心思想是:

当前 DiT-based visual prompt editing 方法虽然把示例图输入进去了,但模型不一定真的“看懂”示例图中的编辑关系。

它可能仍然依赖 text prompt,或者受到 diffusion sampling 随机性的影响,导致结果不稳定。

EditTransfer++ 通过 去文本捷径 + best/worst 对比优化 + 条件压缩复用,让模型更忠实、更稳定、更高效地完成 edit transfer。

可以简单概括成:

模块 解决问题 作用
🧩 Text-Decoupled Training 模型过度依赖文本 强迫模型从 visual prompt 学编辑关系
🎯 Best-Worst Contrastive Refinement 不同 seed 结果不稳定 让模型靠近好轨迹、远离坏轨迹
⚡ Condition Compression 条件图像 token 太多 降低高分辨率推理开销
🔁 Condition Reuse 条件图像重复计算 缓存并复用 condition features

🔍 2. 这篇文章想解决什么问题?

🎯 任务设定:Edit Transfer

给定一个视觉示例:

模型需要理解:

source → target 之间发生了什么变化?

然后把同样的变化迁移到 query image 上。

例如: