****我们采用单一的图像 Tokenizer 同时进行理解和生成任务,以保持架构的简洁性。利用 VILA-U中提出的 Tokenizer,它在保持图像重建质量的同时增强了文本与图像的对齐。 给定一张输入图像,Tokenizer 将其压缩16×16倍,将生成的二维特征展平为一维 Token 序列,并通过一个轻量级的 MLP,然后再将 Token 输入到语言模型中
统一图像理解与生成已成为多模态人工智能领域中一种极具前景的范式。 尽管近期取得了进展,但如何为这类统一模型设计最佳架构仍是一个未解的挑战。
本文首先分析用于理解和生成的特定任务专家模型以及当前统一模型的模态对齐行为。
关键发现:
受此发现启发,我们引入了 UniFork,这是一种新颖的 Y 型架构,它共享浅层以进行跨任务表征学习,同时在更深的层级采用任务特定的分支以避免任务干扰。 这种设计有效地平衡了共享学习与任务专业化
给定一张图像x及其对应的文本提示𝒯,我们将第$l$层 Transformer 提取的视觉特征记为$V_l^{gen}∈ℝ^{n_v×c}$,并将来自最终 Transformer 层的文本提示特征记为$T∈ℝ^{n_t×c}$,$n_v$ 和 $n_t$ 分别表示视觉 Token 和文本 Token 的数量。c 是特征的通道维度。
对于生成任务,我们从 GenEval数据集中采样500个提示词。 在每一层$l$,使用互 k-近邻(两点互相在对方的 K 近邻列表内,才视为有效邻居),计算模态对齐分数$A_l^{gen}$

对于理解任务,我们将生成的图像输入模型,并使用查询指令“Provide a one-sentence caption for the image:”(为该图像提供一句描述:)。 我们从每一层$V_l^{und}$提取视觉特征,并计算该层中$V_l^{und}$与其对应提示特征之间的对齐分数.


生成与理解中发散的对齐模式:
生成任务如图 (a) 所示,对齐分数在早期层增加,但在后期层有所下降。 这一趋势与 REPA 对扩散模型的研究观察结果一致,表明早中期层侧重于跨模态对齐和语义基础,而后期层负责合成高频视觉细节
理解任务如图 (b) 所示,其对齐分数随层数增加而上升,这表明深层中强大的跨模态对齐对于准确理解至关重要
NTP 下全共享主干网络的表征折中