HiDream-O1-Image 的核心是把图像像素、文本 token 和任务条件统一映射到同一个 token 空间中,用一个 Pixel-level Unified Transformer 同时完成文生图、图像编辑和主体个性化任务。
它试图摆脱传统图像生成模型中 VAE + 文本编码器 + 扩散模型 的分离式架构,转向一个更像 LLM 的 端到端、多任务、in-context visual reasoning 框架。
传统视觉生成模型主要有两个瓶颈:
| 问题 | 传统方案 | 局限 |
|---|---|---|
| 图像压缩损失 | Latent Diffusion 使用 VAE 把图像压到 latent space | 高频细节、文字、纹理可能丢失 |
| 模态割裂 | 图像编码、文本编码、生成模块分离 | 文本和视觉语义空间不完全对齐 |
| 任务碎片化 | 文生图、编辑、个性化通常需要不同模块或微调 | 泛化能力弱,难以统一建模 |
| 长文本和复杂布局困难 | 依赖外部文本编码器和 latent 表达 | 文字渲染、图文混排容易出错 |
HiDream-O1-Image 的目标:
把图像生成从“模块拼接”变成“统一 token 空间中的视觉推理”。
HiDream-O1-Image 主要由四个部分组成:
| 模块 | 作用 |
|---|---|
| Reasoning-Driven Prompt Agent | 对用户输入进行“思考式”改写,生成更适合模型的 prompt |
| Unified Multimodal Tokenization | 把文本、条件图像、目标图像像素统一 token 化 |
| Unified Transformer / UiT | 在同一个 Transformer 中处理所有模态 |
| Pixel-space Diffusion Objective | 直接在像素空间做扩散建模,避免 VAE 信息损失 |
Unified Multimodal Tokenization 的目标,是把文本 prompt、视觉条件图像、生成目标图像三类不同输入,统一映射到同一个 shared token space 中。
这样模型可以把不同模态的信息拼接成一个统一 token 序列,再交给后续的 Unified Transformer blocks 做联合上下文建模。