🧠 核心问题:Context Gap(上下文鸿沟)

现有文生图模型在真实世界任务中表现欠佳,根本原因在于训练与部署之间存在结构性错位:

作者将这种差距定义为 Context Gap:用户提供的上下文(user context)与图像生成所需的完整上下文(generation context)之间的鸿沟。


💡 解决方案:Qwen-Image-Agent

提出了一个统一的 Agentic 框架,将以下能力整合于以上下文为中心的流程中:

能力模块 作用
Plan(规划) 分解复杂意图,识别缺失信息
Reason(推理) 推断隐式意图与常识
Search(搜索) 检索实时知识与视觉参考
Memory(记忆) 维护多轮对话历史与用户偏好
Feedback(反馈) 迭代自检与纠错

框架特点:无需训练、兼容现有图像生成器、支持多图与多轮交互。


🏗️ 框架结构详解

1. Context-Aware Planning(上下文感知规划)

运作于三个层级:

Information-level(信息层) 识别上下文鸿沟,提出具体问题,并将每个问题路由至合适的 Grounding 策略(推理、网络搜索、图片搜索)。

Content-level(内容层) 汇总 Grounding 阶段获得的所有上下文,将用户提示词改写为详细的生成规格,涵盖主体、属性、布局、风格、文字元素。

Generation-level(生成层) 在多图与多轮场景中分配生成上下文: