<aside>
Task-Aware Expert Routing: 给 MoE 路由加入任务语义信息,让专家按任务分工,从而缓解统一图像生成中的任务干扰。 本质是:把 global intent 注入 local decision.
</aside>
<aside> 💡

统一模型(生成 + 编辑)中:
👉 冲突:同一套参数难以同时满足 → 性能下降
不同图像生成任务的目标之间存在内在冲突。 编辑任务(例如风格迁移、物体移除)要求在修改局部时精确保留区域信息,而定制化任务(例如主体驱动的生成)则要求在新的上下文中保持强一致的身份特征。 由于缺乏对这些截然不同且往往相互竞争的需求的显式建模,现有方法难以自适应地满足用户多样化的意图,限制了鲁棒性和泛化能力。
</aside>
<aside> 💡
MoE 是:每个词(token)完全独立地、单独地选择自己的专家,独立计算,最后独立加权。 (a) 词 A 选 专家 2、5 (b) 词 B 可以选 专家 0、3 (c)互相完全不干扰。
虽然 MoE 可以提升容量,但:
👉 结果:
<aside>
将任务结构化为:
得到统一任务表示
</aside>
<aside>
传统:router(token)
现在:router(token, task_semantics)
👉 路由同时依赖:
<aside>
核心约束: routing pattern → 可以预测 task semantics
等价于:
👉 本质:把“任务信息”压进路由空间
</aside>
<aside>
<aside>
<aside>

TAG-MoE 包括:(1) 带有 MoE 层的 MM-DiT;(2) 一种分层任务语义标注,使用原子任务描述符对训练数据进行标注;(3) 一种新颖的语义对齐路由器,通过预测性对齐正则化将 MoE 路由行为与任务语义显式对齐
</aside>
模型基于 MM-DiT,将多模态输入统一为一个 Token 序列:
CI_c → z_c(通过 VAE 编码器 ℰ) 目标图像:I_0 → z_0z_0 加噪得到:z_tz_c 和 z_t → 切片为视觉 tokens将以下内容拼接为一个统一序列输入 MM-DiT:
文本 tokens:C | 条件图像 tokens:z_c| 带噪图像 tokens:z_t
结合 时间步 embedding:t
${E₁, ..., E_N}$𝒢(x)(输出每个专家的权重)对每个 token:
𝒢(x)𝒯$$ \text{MoE}(x) = \sum_{E_i \in \mathcal{T}(x)} \mathcal{G}(x)_i \cdot E_i(x) $$
👉 即:稀疏激活 + 专家加权融合
</aside>
<aside>
</aside>
<aside>
</aside>