VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning

Zhong-Yu Li*, Ruoyi Du*, Juncheng Yan, Le Zhuo, Zhen Li, Peng Gao, Zhanyu Ma, Ming-Ming Cheng

ICCV 2025


📌 一句话总结

VisualCloze 将不同图像生成任务统一表示为一个视觉完形填空问题:模型先观察若干完整的输入—输出示例,再根据新的输入条件,补全网格中缺失的目标图像。

其核心并不是设计新的生成架构,而是将 Visual In-Context Learning、Graph200K 多任务数据和 FLUX.1-Fill 图像填充模型结合起来,实现统一的条件生成、图像编辑、风格迁移、图像恢复和主体保持生成。(CVF Open Access)


🎯 研究动机

现有通用图像生成模型主要面临三个问题:

1. 语言指令存在任务歧义

仅使用文本描述任务时,模型可能无法准确区分:

视觉生成模型对复杂语言任务定义的理解仍然有限,容易产生 Task Confusion。

2. 视觉任务之间较为孤立

自然语言任务之间通常存在大量共享结构,而深度生成、边缘生成、图像恢复和主体保持等视觉任务的数据分布相对独立,模型难以学习可迁移的跨任务表示。

3. 不同任务通常需要不同架构

ControlNet、Reference Adapter 和图像编辑模型往往需要额外的条件分支或任务模块,不利于扩展到更多任务。

VisualCloze 的目标是: