统一多模态模型(UMM)在理解与生成之间存在语义不一致:模型能生成正确反映文本提示的图像,但在重新理解自己生成的图像时出现语义漂移(semantic drift)。
典型案例:输入 "a red book" → 模型生成图像 → 模型重新描述该图像 → 输出 "a yellow book"
现有自我修正方法(推理时精炼 / 后训练方法)通过迭代修正输出改善一致性,但没有从根本上约束共享潜空间中理解与生成之间的交互,无法解决双向编解码对齐缺失这一根本问题。
LatentUMM 是一个两阶段框架,在预训练 UMM 的潜空间之上构建更一致的多模态表示空间。
形式化:给定文本-图像对 (xₜ, xᵢ),引入更强的外部嵌入模型 E*(·),其输出维度与 UMM 潜表示 z 相同,可直接几何比较,无需额外投影层。
将文本与图像映射到 E* 诱导的同一空间后,最小化模态对距离:
L_x-modal = ‖φ(xₜ) − φ(xᵢ)‖²₂
在比原始 UMM 潜空间更结构化的嵌入空间中强制跨模态语义对齐,构建精炼的共享语义几何。嵌入模型 E* 可选:Gemini Embedding(默认)、CLIP、SigLIP。