EditTransfer++ 的核心思想是:
当前 DiT-based visual prompt editing 方法虽然把示例图输入进去了,但模型不一定真的“看懂”示例图中的编辑关系。
它可能仍然依赖 text prompt,或者受到 diffusion sampling 随机性的影响,导致结果不稳定。
EditTransfer++ 通过 去文本捷径 + best/worst 对比优化 + 条件压缩复用,让模型更忠实、更稳定、更高效地完成 edit transfer。
可以简单概括成:
| 模块 | 解决问题 | 作用 |
|---|---|---|
| 🧩 Text-Decoupled Training | 模型过度依赖文本 | 强迫模型从 visual prompt 学编辑关系 |
| 🎯 Best-Worst Contrastive Refinement | 不同 seed 结果不稳定 | 让模型靠近好轨迹、远离坏轨迹 |
| ⚡ Condition Compression | 条件图像 token 太多 | 降低高分辨率推理开销 |
| 🔁 Condition Reuse | 条件图像重复计算 | 缓存并复用 condition features |
给定一个视觉示例:
模型需要理解:
source → target 之间发生了什么变化?
然后把同样的变化迁移到 query image 上。
例如: