大规模 T2I(text-to-image)预训练的扩散模型已被用于稠密视觉感知任务,但其迁移过程中的关键设计决策缺乏系统性验证:
单步确定性推理 ≈ 多步随机推理 通过调整 diffusion scheduler 的超参数,可以将多步生成简化为一步微调范式,性能无损失。扩散的随机性对确定性感知任务有轻微负面影响。
U-Net 编解码器均含有丰富先验 扩散模型的视觉先验知识广泛分布于 U-Net 的 encoder 和 decoder 中,全参数微调比 LoRA 等部分微调方式更能激活这些先验。
固定 timestep 为 0,文本提示作用有限 对于感知任务,将 timestep 固定为 t=0 即可去除随机性;文本提示对感知任务的增益不明显,可用空提示替代。
任务级图像监督显著提升细节 仅用 latent space 监督不够,添加 task-specific 的图像级损失函数和自定义解码器,能大幅提升预测的细粒度细节质量。
高质量微调数据是最关键因素 数据质量对几何与语义感知任务均至关重要,优先于模型结构的调整。高质量数据带来的增益远超大量低质量数据。
核心思想:一步确定性推理范式(Deterministic One-Step Perception),去除 VAE decoder,支持像素级损失与自定义解码器,推理速度大幅提升。