VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning
Zhong-Yu Li*, Ruoyi Du*, Juncheng Yan, Le Zhuo, Zhen Li, Peng Gao, Zhanyu Ma, Ming-Ming Cheng
ICCV 2025
VisualCloze 将不同图像生成任务统一表示为一个视觉完形填空问题:模型先观察若干完整的输入—输出示例,再根据新的输入条件,补全网格中缺失的目标图像。
其核心并不是设计新的生成架构,而是将 Visual In-Context Learning、Graph200K 多任务数据和 FLUX.1-Fill 图像填充模型结合起来,实现统一的条件生成、图像编辑、风格迁移、图像恢复和主体保持生成。(CVF Open Access)
现有通用图像生成模型主要面临三个问题:
仅使用文本描述任务时,模型可能无法准确区分:
视觉生成模型对复杂语言任务定义的理解仍然有限,容易产生 Task Confusion。
自然语言任务之间通常存在大量共享结构,而深度生成、边缘生成、图像恢复和主体保持等视觉任务的数据分布相对独立,模型难以学习可迁移的跨任务表示。
ControlNet、Reference Adapter 和图像编辑模型往往需要额外的条件分支或任务模块,不利于扩展到更多任务。
VisualCloze 的目标是: