现有文生图模型在真实世界任务中表现欠佳,根本原因在于训练与部署之间存在结构性错位:
作者将这种差距定义为 Context Gap:用户提供的上下文(user context)与图像生成所需的完整上下文(generation context)之间的鸿沟。
提出了一个统一的 Agentic 框架,将以下能力整合于以上下文为中心的流程中:
| 能力模块 | 作用 |
|---|---|
| Plan(规划) | 分解复杂意图,识别缺失信息 |
| Reason(推理) | 推断隐式意图与常识 |
| Search(搜索) | 检索实时知识与视觉参考 |
| Memory(记忆) | 维护多轮对话历史与用户偏好 |
| Feedback(反馈) | 迭代自检与纠错 |
框架特点:无需训练、兼容现有图像生成器、支持多图与多轮交互。
运作于三个层级:
Information-level(信息层) 识别上下文鸿沟,提出具体问题,并将每个问题路由至合适的 Grounding 策略(推理、网络搜索、图片搜索)。
Content-level(内容层) 汇总 Grounding 阶段获得的所有上下文,将用户提示词改写为详细的生成规格,涵盖主体、属性、布局、风格、文字元素。
Generation-level(生成层) 在多图与多轮场景中分配生成上下文: