🧠 一句话总结

HiDream-O1-Image 的核心是把图像像素、文本 token 和任务条件统一映射到同一个 token 空间中,用一个 Pixel-level Unified Transformer 同时完成文生图、图像编辑和主体个性化任务。

它试图摆脱传统图像生成模型中 VAE + 文本编码器 + 扩散模型 的分离式架构,转向一个更像 LLM 的 端到端、多任务、in-context visual reasoning 框架。


🎯 核心问题:为什么需要 HiDream-O1-Image?

传统视觉生成模型主要有两个瓶颈:

问题 传统方案 局限
图像压缩损失 Latent Diffusion 使用 VAE 把图像压到 latent space 高频细节、文字、纹理可能丢失
模态割裂 图像编码、文本编码、生成模块分离 文本和视觉语义空间不完全对齐
任务碎片化 文生图、编辑、个性化通常需要不同模块或微调 泛化能力弱,难以统一建模
长文本和复杂布局困难 依赖外部文本编码器和 latent 表达 文字渲染、图文混排容易出错

HiDream-O1-Image 的目标:

把图像生成从“模块拼接”变成“统一 token 空间中的视觉推理”。


🧩 方法总览

🌟 核心设计

HiDream-O1-Image 主要由四个部分组成:

模块 作用
Reasoning-Driven Prompt Agent 对用户输入进行“思考式”改写,生成更适合模型的 prompt
Unified Multimodal Tokenization 把文本、条件图像、目标图像像素统一 token 化
Unified Transformer / UiT 在同一个 Transformer 中处理所有模态
Pixel-space Diffusion Objective 直接在像素空间做扩散建模,避免 VAE 信息损失

🏗️ 架构重点:Pixel-level Unified Transformer

1. 原生统一 token 空间 Unified Multimodal Tokenization

核心作用

Unified Multimodal Tokenization 的目标,是把文本 prompt、视觉条件图像、生成目标图像三类不同输入,统一映射到同一个 shared token space 中。

这样模型可以把不同模态的信息拼接成一个统一 token 序列,再交给后续的 Unified Transformer blocks 做联合上下文建模。