🎯 研究背景与动机
核心方向:统一多模态模型(Unified Multimodal Models, UMMs)——将视觉理解与视觉生成整合到同一个框架中
现有方法的三大核心问题
问题 1:学习冲突(Learning Conflicts)
- 理解任务和生成任务在视觉特征提取上存在根本矛盾
- 理解任务需要高语义、低频特征;生成任务需要高频细节恢复
- 同一模块承担两类任务导致两者均次优化
问题 2:视觉空间不一致(Mismatched Visual Spaces)
- 理解任务的视觉表示空间与生成任务的视觉空间不兼容
- 阻碍了模型的可扩展性(scalability)
问题 3:数据利用低效(Over-reliance on Task-specific Data)
- 过度依赖特定任务数据,未能充分挖掘"图文理解"与"图文生成"之间的内在对偶性
💡 核心贡献
- UniDDT 框架:提出解耦扩散 Transformer,将语义编码(LLM side)与扩散解码(Diffusion side)分离
- Noisy ViT 编码器:统一理解与生成的视觉潜在空间表示
- 双重数据结构(Dual Data Structure):从同一批图文对同时构建理解训练数据与生成训练数据,利用两者的内在对偶性
🏗️ 方法详解