基本信息

注意:本文的 in-context editing 指模型利用整段多轮编辑历史完成后续编辑,并不是通过示例图像对迁移变换的 Visual In-Context Learning。


一句话总结

Edit-R2 将多轮图像编辑建模为一个长时序强化学习问题:模型先利用 IC-CoT 从图文历史中恢复当前真正生效的用户意图,再通过统一的 RL 目标联合优化文本推理和 Flow Matching 图像生成,同时过滤已经失败的多轮轨迹,减少错误传播。


1. 研究背景与问题

现有图像编辑模型主要面向单轮任务:

$Y_{t+1}=\pi(Y_t,T_t)$

即模型只需要根据当前图像 ($Y_t$) 和当前指令 ($T_t)$ 生成结果。

但真实交互通常是多轮的。例如:

  1. 把杯子变成红色;
  2. 把它移动到桌子上;
  3. 删除它。

第三轮中的“它”必须结合前两轮历史才能理解。此外,用户还可能提出持续性约束,例如: