🔍 核心问题 · 研究动机

痛点

统一多模态模型(UMM)在理解与生成之间存在语义不一致:模型能生成正确反映文本提示的图像,但在重新理解自己生成的图像时出现语义漂移(semantic drift)。

典型案例:输入 "a red book" → 模型生成图像 → 模型重新描述该图像 → 输出 "a yellow book"

根本原因

现有方案的不足

现有自我修正方法(推理时精炼 / 后训练方法)通过迭代修正输出改善一致性,但没有从根本上约束共享潜空间中理解与生成之间的交互,无法解决双向编解码对齐缺失这一根本问题。


🛠 方法框架 · LatentUMM

LatentUMM 是一个两阶段框架,在预训练 UMM 的潜空间之上构建更一致的多模态表示空间。

Stage 1:双重潜空间对齐(Dual Latent Alignment)

形式化:给定文本-图像对 (xₜ, xᵢ),引入更强的外部嵌入模型 E*(·),其输出维度与 UMM 潜表示 z 相同,可直接几何比较,无需额外投影层。

模态对齐(Cross-Modal Alignment)

将文本与图像映射到 E* 诱导的同一空间后,最小化模态对距离:

L_x-modal = ‖φ(xₜ) − φ(xᵢ)‖²₂

在比原始 UMM 潜空间更结构化的嵌入空间中强制跨模态语义对齐,构建精炼的共享语义几何。嵌入模型 E* 可选:Gemini Embedding(默认)、CLIP、SigLIP。