🎯 研究背景与动机

核心方向:统一多模态模型(Unified Multimodal Models, UMMs)——将视觉理解与视觉生成整合到同一个框架中

现有方法的三大核心问题

问题 1:学习冲突(Learning Conflicts)

问题 2:视觉空间不一致(Mismatched Visual Spaces)

问题 3:数据利用低效(Over-reliance on Task-specific Data)


💡 核心贡献

  1. UniDDT 框架:提出解耦扩散 Transformer,将语义编码(LLM side)与扩散解码(Diffusion side)分离
  2. Noisy ViT 编码器:统一理解与生成的视觉潜在空间表示
  3. 双重数据结构(Dual Data Structure):从同一批图文对同时构建理解训练数据与生成训练数据,利用两者的内在对偶性

🏗️ 方法详解