会议: ECCV 2026
核心内容: 推理型图像编辑 Benchmark + 100K 训练数据 + Bagel 微调模型
代码/数据: UniREditBench、UniREdit-Data-100K、UniREdit-Bagel 均已开源。项目页标注该工作被 ECCV 2026 接收。
现有图像编辑 Benchmark 主要评测:
但对于真正复杂的推理型编辑,仍存在两个不足:
场景覆盖有限
现有数据大多聚焦真实世界中的单物体变化,较少涉及多物体物理交互,以及迷宫、数独、推箱子等由显式规则控制的游戏场景。
评测参考不足
现有 VLM Judge 通常只使用编辑指令和文字描述作为参考。复杂编辑可能存在多个空间位置、路径或状态约束,仅靠文字容易漏判错误结果。
因此,论文希望回答:
当前图像编辑模型是否真正理解了编辑背后的物理、空间和逻辑规则,而不只是生成一张表面上符合指令的图片?
论文包含三个相互关联的部分:
一个包含 2,700 个样本的推理型图像编辑 Benchmark,覆盖: